Introduction
Lorsque vous configurez une grille d’évaluation personnalisée pour un scénario de jeu de rôle avec l’IA, la qualité de vos critères détermine directement la qualité des commentaires de l’IA. Une grille d’évaluation bien rédigée produit des commentaires précis et exploitables. Une grille vague produit des commentaires génériques et difficiles à appliquer.
Cet article fournit des directives pour rédiger des critères efficaces et inclut des exemples que vous pouvez adapter à votre contexte.
Si vous préférez, vous pouvez demander à l’IA de générer des critères comme point de départ, puis les affiner.
Pour des instructions étape par étape sur la configuration d’une grille d’évaluation, consultez l’article Utiliser le jeu de rôle avec l’IA dans Creator.
La seule règle qui compte
L’IA génère des commentaires uniquement à partir de la transcription de la conversation ; elle lit ce qui a été dit, et non la manière dont cela a été dit. Avant d’enregistrer un critère, posez-vous la question : « pourrais-je évaluer cela uniquement en lisant la transcription ? » Si oui, cela fonctionne. Si vous deviez écouter l’audio ou regarder un enregistrement, cela ne fonctionnera pas.
Critères qui fonctionnent bien
- Qualité comportementale : l’apprenant a-t-il fait quelque chose de spécifique, et dans quelle mesure l’a-t-il bien fait ?
- Compétences de communication de base fondées sur des comportements observables, comme la clarté, l’écoute active ou la concision
- Ton et formulation tels que reflétés dans le choix des mots (par exemple, « utilise une langue de responsabilité » est observable dans le texte ; « semble chaleureux » ne l’est pas)
- Courtes checklists comportementales comprenant 3 à 5 étapes observables (par exemple, « ont-ils commencé par un énoncé du problème ? Ont-ils quantifié l’impact ? Ont-ils conclu par une demande claire ? »)
Critères qui ne fonctionneront pas
- Expression vocale : ton de la voix, rythme, prononciation, volume
- Langue corporelle ou présence à l’écran : posture, contact visuel, expressions faciales
- Comptage précis : nombre d’interruptions, fréquence des mots clés
- Ratios mathématiques : temps de parole, latence de réponse
- Correspondance exacte d’expressions ou checklists scénarisées de plus de 10 éléments — plus il y a d’étapes, plus l’IA risque d’en manquer ou de les confondre. Si vous avez un cadre long, divisez-le en 2 ou 3 critères couvrant chacun une partie significative
- Déduction d’intentions masquées : ce que quelqu’un voulait dire mais n’a pas dit
Rédiger chaque champ
Les noms de champs diffèrent légèrement selon le type de grille d’évaluation (qualitative ou quantitative), mais les mêmes principes s’appliquent aux deux.
Nom du critère
Fournissez un nom clair et spécifique pour le critère.
Bon exemple : « écoute active », « gestion des objections », « réponse empathique »
Mauvais exemple : « bien écouter », « communication », « compétences interpersonnelles » (trop vague et pas assez spécifique)
Description
Rédigez une ou deux phrases expliquant ce que couvre le critère. Rédigez-les comme si vous donniez des instructions à un nouvel évaluateur.
Bon exemple : « ce critère évalue si l’apprenant démontre sa compréhension en paraphrasant, en posant des questions de clarification et en répondant directement aux préoccupations exprimées. »
Mauvais exemple : « comment l’apprenant communique. » (trop large — l’IA ne saura pas quoi chercher.)
Mauvais exemple : texte de remplissage tel que « Lorem ipsum » ou caractères répétés. Les textes de remplissage dénués de sens affectent négativement la qualité des commentaires.
À quoi ressemble une bonne performance / Score élevé (5)
Définissez à quoi ressemble une performance solide. Vous pouvez inclure des exemples d’expressions, de comportements, d’actions ou d’éléments requis.
Bon exemple : « reflète les points clés soulevés par l’interlocuteur, pose des questions de suivi pertinentes et répond directement aux préoccupations exprimées. Utilise la reformulation et la clarification pour confirmer la compréhension. »
Mauvais exemple : « maintient un ton calme, un volume approprié, un rythme régulier et une intonation variée pour signaler un intérêt et une empathie sincères. » (l’expression vocale ne peut pas être évaluée à partir de la transcription.)
Score moyen (3 - grille d’évaluation quantitative uniquement)
Définissez à quoi ressemble une performance partielle : l’apprenant démontre la compétence dans une certaine mesure mais avec des lacunes évidentes. Décrivez ce qui est présent et ce qui manque par rapport à une performance solide.
Bon exemple : « pose des questions pertinentes mais ne fait pas de suivi sur les réponses du prospect. Couvre les besoins de surface sans explorer les priorités sous-jacentes. »
Mauvais exemple : « assez bien. » (il ne s’agit pas d’une description de comportement — l’IA ne peut pas l’utiliser pour calibrer un score.)
À quoi ressemble une performance en développement / Score faible (1)
Définissez à quoi ressemble une performance plus faible. Incluez des indicateurs concrets et observables.
Bon exemple : « avance sans reconnaître les préoccupations de l’interlocuteur. Ignore les points clés ou répond avec des informations sans rapport. »
Mauvais exemple : « l’auditeur semble désengagé et ne parvient pas à démontrer sa compréhension tant par le contenu que par l’expression vocale. » (inclut des dimensions non prises en charge telles que le ton et le rythme.)
Exemples que vous pouvez adapter
Ventes — Gérer une objection de prix
- Titre du critère : reconnaître l’objection
- Description : évalue si l’apprenant valide la préoccupation du prospect concernant les tarifs avant de défendre la valeur du produit.
- À quoi ressemble une bonne performance : nomme explicitement la préoccupation (« je comprends que le coût est une véritable considération ici »), évite de passer immédiatement à la justification et invite le prospect à partager plus de contexte avant de répondre.
- À quoi ressemble une performance en développement : passe directement à la justification de la valeur ou à des offres de remise sans reconnaître la préoccupation sous-jacente. Peut faire indirectement référence au prix mais ne s’engage pas sur ce que le prospect a réellement dit.
Service client — Résoudre une plainte
- Titre du critère : prendre en charge
- Description : évalue si l’apprenant prend clairement la responsabilité du problème plutôt que de s’en défausser, même lorsque la faute incombe à un tiers ou à un process.
- À quoi ressemble une bonne performance : utilise une langue de responsabilité à la première personne (« je vais m’assurer que ce problème soit résolu »). Évite les constructions passives ou la langue de reproche. Énonce une étape suivante claire.
- À quoi ressemble une performance en développement : utilise une langue d’évitement (« c’est géré par une autre équipe », « le système n’autorise pas... »). Peut exprimer de la sympathie mais ne s’engage pas à prendre en charge le problème ou à proposer une voie claire à suivre.
Leadership — Donner des commentaires difficiles
- Titre du critère : spécificité des commentaires
- Description : évalue si les commentaires de l’apprenant font référence à des comportements concrets et observables plutôt qu’à des impressions générales ou des traits de personnalité.
- À quoi ressemble une bonne performance : décrit une situation spécifique, nomme le comportement observable et le relie à un impact (« lors de la réunion de mardi dernier, quand vous avez interrompu Sarah à deux reprises, cela a mis fin à la conversation avant que son idée ne soit comprise »).
- À quoi ressemble une performance en développement : les commentaires restent au niveau de l’impression générale (« vous devez faire preuve de plus de professionnalisme » ou « vous donnez parfois l’impression d’être dédaigneux »). Aucune situation ni aucun comportement spécifique n’est mentionné.
Rédiger des prompts efficaces pour des critères générés par l’IA
Au lieu de rédiger les critères manuellement, vous pouvez demander à l’IA de les générer. Les directives suivantes vous aident à obtenir de meilleurs résultats de génération.
Décrire le comportement, et pas seulement le sujet
Au lieu de nommer une compétence large, décrivez le comportement observable que vous souhaitez voir l’apprenant démontrer. L’IA génère jusqu’à 5 critères en fonction de votre demande. Si vous souhaitez évaluer plus de 5 compétences, précisez quelles sont les 5 de priorité la plus élevée.
Bon exemple : « évaluer si l’apprenant gère les objections de tarifs en reconnaissant la préoccupation du prospect avant d’expliquer la valeur du produit. »
Mauvais exemple : « compétences en ventes »
Donner la priorité aux compétences les plus importantes
Si votre demande ou vos documents justificatifs couvrent plus de 5 compétences de communication, indiquez à l’IA quelles compétences sont les plus importantes.
Bon exemple : « générer des critères basés sur notre playbook de ventes. Se concentrer sur ces 5 compétences : découverte des besoins, gestion des objections, communication de la valeur, écoute active et conclusion de la conversation. »
Mauvais exemple : « générer des critères à partir de notre playbook de ventes. » (le playbook couvre des dizaines de compétences, de sorte que l’IA n’a aucune directive sur celles à prioriser.)
Demander uniquement des critères pris en charge
Évitez de demander des critères qui ne peuvent pas être évalués à partir de la transcription d’une conversation. Pour la liste complète des critères qui ne fonctionneront pas, référez-vous à la section Critères qui ne fonctionneront pas ci-dessus.
Bon exemple : « évaluer si l’apprenant écoute activement en reconnaissant les préoccupations, en posant des questions de clarification et en répondant directement à ce que le client dit. »
Mauvais exemple : « évaluer si l’apprenant maintient un ton de voix confiant, un rythme d’élocution approprié, un bon contact visuel et une langue corporelle positive. » (ces comportements ne peuvent pas être évalués à partir de la transcription d’une conversation.)
Utiliser les documents justificatifs de manière stratégique
Téléversez des documents qui sont directement pertinents pour la grille d’évaluation que vous souhaitez générer, tels que des playbooks de ventes, des guides de coaching, des cadres de compétences ou des standards de communication. Indiquez à l’IA comment utiliser le document. Par exemple :
- « générer des critères basés sur nos standards de service client. »
- « prioriser les compétences décrites dans la section sur l’intégration. »
- « utiliser notre méthodologie de ventes comme base pour les critères. »
Gardez les documents concis et ciblés. Si un document est long ou couvre de nombreux sujets, résumez plutôt les points les plus pertinents dans le champ de texte.
À noter :
- Les documents téléversés sont utilisés uniquement pour générer les critères. Ils ne sont pas utilisés ultérieurement lors de l’évaluation des performances de l’apprenant.
- Si vos documents décrivent plus de 5 compétences, spécifiez les 5 que vous souhaitez inclure.