7 heures du matin, avant l’arrivée du reste de l’équipe support : c’est le moment choisi pour tester en petit comité un résumé automatique de tickets HubSpot, avant toute décision de généralisation à l’ensemble de l’équipe. L’objectif était simple — faire gagner du temps aux agents qui reprennent un ticket resté ouvert plusieurs jours, sans relire l’intégralité de l’échange. La configuration du CRM lui-même n’est pas abordée ici.
Le test portait sur 60 tickets déjà clos, choisis pour leur longueur et leur complexité, avec un résumé généré par LLM comparé systématiquement au ticket complet par un agent expérimenté.
Pourquoi une checklist plutôt qu’un simple contrôle qualité
Un résumé généré par IA se lit presque toujours bien : phrases fluides, structure claire, ton neutre. Cette qualité apparente masque un risque spécifique, différent de l’hallucination pure : l’omission silencieuse d’une information importante, sans qu’aucun signal visible n’alerte le lecteur pressé. Une checklist formalisée permet de vérifier ce risque précis, plutôt que de se fier à une impression de fluidité.
Contrairement à un cas d’invention pure d’information, l’omission est plus insidieuse : le résumé reste factuellement exact sur ce qu’il mentionne, mais incomplet sur ce qui compte réellement pour la suite du traitement du ticket.
La checklist en cinq points

- Le motif initial du ticket est-il correctement identifié ? Un résumé qui déplace l’accent vers un sujet secondaire égare l’agent qui reprend le dossier.
- Les engagements pris par un agent précédent apparaissent-ils ? Une promesse de remboursement ou de geste commercial omise dans le résumé peut être oubliée dans le suivi.
- Le statut réel du problème est-il clair ? Résolu, en attente du client, ou en attente d’une action interne : ces trois statuts ne doivent jamais être confondus.
- Les informations sensibles (numéro de commande, montant) sont-elles reprises fidèlement ? Une erreur de chiffre, même isolée, invalide la confiance dans tout le résumé.
- Le ton du client est-il correctement restitué ? Un client mécontent résumé sur un ton neutre peut conduire à sous-estimer l’urgence d’un dossier.
Ce que le test a révélé
Sur les 60 tickets testés, neuf résumés omettaient un engagement pris par un agent précédent, information jugée critique pour la suite du traitement. Quatre résumés supplémentaires minimisaient le ton clairement irrité d’un client, le restituant de façon neutre alors que l’échange complet montrait une frustration croissante sur plusieurs messages.
| Point de vérification | Tickets concernés sur 60 |
|---|---|
| Engagement précédent omis | 9 |
| Ton du client mal restitué | 4 |
| Statut réel ambigu | 3 |
| Erreur sur une donnée chiffrée | 1 |
Aucun résumé n’a inventé d’information totalement absente du ticket original ; le risque observé portait presque exclusivement sur l’omission, jamais sur l’invention pure.
Le prompt ajusté après le test
Le prompt de génération a été enrichi d’une instruction explicite : « Mentionne systématiquement tout engagement pris par un agent, ainsi que le ton général exprimé par le client, même s’il te semble secondaire. » Cette consigne a réduit à deux le nombre de résumés incomplets sur un second lot de 60 tickets, sans les faire disparaître totalement.
Un résumé automatique de ticket support ne doit jamais remplacer la lecture complète en cas de doute : il doit seulement dispenser de cette lecture quand rien dans le résumé n’appelle une vérification supplémentaire.
En résumé
Avant de généraliser un résumé automatique de tickets à toute une équipe support, la checklist en cinq points s’est révélée plus fiable qu’un jugement global sur la qualité rédactionnelle du texte généré. Le risque principal ne réside pas dans l’invention d’informations fausses, mais dans l’omission silencieuse de détails dont l’absence ne se voit qu’en comparant au ticket complet.
La généralisation à toute l’équipe support n’a finalement eu lieu qu’après un second test sur 60 tickets supplémentaires, avec le prompt révisé, pour confirmer que le taux d’omission restait bas de façon stable et pas seulement sur un échantillon favorable. Cette prudence a été jugée préférable à une adoption précipitée sur la seule foi du premier test, compte tenu de l’impact direct d’un résumé incomplet sur la qualité du suivi client rendu à chaque dossier repris par un nouvel agent.