« Quelle est la capitale administrative de la comptabilité analytique ? » Cette question, générée automatiquement pour un module de formation en gestion, n’a évidemment aucun sens — mais elle a bien failli être publiée telle quelle, noyée dans un lot de 60 questions produites en une seule session avec un LLM.
Ce centre de formation en ligne, spécialisé dans les certifications comptables et RH, a construit une checklist en cinq points après cet incident, pour cadrer la relecture de tout quiz généré automatiquement avant sa mise en ligne sur la plateforme e-learning. La plateforme elle-même n’est pas traitée ici.
Pourquoi générer des quiz par IA
Avec un catalogue de 40 modules et un objectif de renouvellement trimestriel des questions pour limiter le bachotage entre apprenants, la rédaction manuelle représentait une charge de travail disproportionnée pour l’équipe pédagogique, réduite à deux personnes. Le LLM a été mis à contribution pour générer des variantes de questions à partir du contenu texte de chaque module, avec un prompt précisant le niveau de difficulté visé et le format attendu.
Le gain de temps a été réel : une session de génération produisait en quelques minutes ce qui aurait demandé une demi-journée de rédaction manuelle. Mais ce gain n’a de valeur que si la relecture qui suit est rigoureuse — d’où la nécessité d’un cadre formalisé plutôt qu’une relecture au fil de l’eau.
La checklist en cinq points

- La question a-t-elle un sens autonome ? Une question qui ne peut être comprise sans le contexte exact du paragraphe source doit être reformulée ou écartée.
- La bonne réponse est-elle réellement la seule correcte ? Sur les questions à choix multiples, le LLM valide parfois deux réponses simultanément correctes selon l’interprétation retenue.
- Les mauvaises réponses sont-elles plausibles mais fausses ? Une distraction trop absurde (comme la « capitale » citée en introduction) trahit une génération incontrôlée.
- Le niveau de difficulté correspond-il au module ? Une question de niveau débutant glissée dans un module avancé fausse la notation globale.
- La terminologie est-elle celle du référentiel de certification ? Le LLM emploie parfois un synonyme correct dans l’absolu mais absent du vocabulaire certifiant enseigné.
Ce que le premier lot a révélé
Sur les 60 premières questions générées, 21 % ont nécessité une correction avant publication, réparties ainsi : neuf questions à choix multiples avec deux réponses valides, quatre questions hors contexte, et trois questions à la terminologie non conforme au référentiel. Aucune n’a été jugée totalement inutilisable, mais toutes auraient introduit une ambiguïté préjudiciable à l’évaluation des apprenants si elles étaient passées telles quelles.
| Type de problème | Occurrences | Correction appliquée |
|---|---|---|
| Deux réponses valides | 9 | Reformulation d’une des distractions |
| Question hors contexte | 4 | Suppression |
| Terminologie non conforme | 3 | Remplacement du terme |
| Niveau inadapté | 1 | Déplacement vers un autre module |
Le prompt révisé
Le prompt initial a été enrichi d’une contrainte explicite pour réduire ce taux d’erreur en amont : imposer une seule réponse correcte et interdire les distractions absurdes ou hors sujet. Cette révision a fait baisser le taux de correction nécessaire à 11 % sur le lot suivant, sans jamais tomber à zéro.
Un quiz généré par IA reste un brouillon pédagogique, jamais un produit fini : la relecture par un formateur qui connaît le référentiel de certification n’est pas négociable, quelle que soit la qualité apparente du texte généré.
En résumé
La génération automatique de quiz fait gagner un temps précieux sur la première rédaction, mais ne dispense jamais d’une relecture structurée par une personne qui maîtrise le contenu enseigné. Une checklist courte, appliquée systématiquement plutôt qu’occasionnellement, reste le meilleur rempart contre une question ambiguë qui finirait par pénaliser un apprenant de bonne foi.
Le prochain chantier de l’équipe pédagogique consiste à formaliser cette checklist dans un court module de formation interne, pour que tout nouveau formateur amené à relire des questions générées applique le même niveau d’exigence, plutôt que de réinventer sa propre méthode de vérification au fil des sessions de relecture.