Aller au contenu

Agents IA

Évaluer un agent IA : construire un plan de test fiable

Évaluer un agent IA consiste à vérifier son comportement sur des tâches et des risques définis, pas à collectionner quelques réponses convaincantes. Un plan fiable relie chaque cas à un résultat attendu, une conséquence d’erreur, une méthode de revue et un seuil de décision.

Binov · 5 min ·

Dans ce guide

1. Définir ce qui est évalué

Fixez la version des instructions, des outils, du modèle, des sources et des règles métier. Sans cette configuration, un résultat ne peut pas être reproduit ni comparé. Précisez aussi le rôle de l’utilisateur et les permissions actives pendant le test.

Exemple fictif : un agent prépare un changement d’adresse à partir d’une demande client. Il doit vérifier l’identité, retrouver le dossier, extraire la nouvelle valeur et proposer la modification. L’évaluation ne porte donc pas seulement sur le texte produit, mais sur chaque étape et sur l’absence d’écriture avant validation.

Élément Version ou périmètre à consigner
Tâche Entrée, sortie et étapes autorisées
Données Échantillon, droits et date de référence
Outils Interfaces, environnement et actions disponibles
Configuration IA Modèle, instructions et paramètres utiles
Contrôles Validations de code, approbations et arrêts

2. Constituer un jeu de cas représentatif

Partez de situations réelles anonymisées lorsque vous avez le droit de les utiliser. Séparez les cas ordinaires, les limites, les exceptions et les tentatives interdites. Un jeu composé uniquement de demandes propres et complètes surestime la qualité en production.

Famille Exemple fictif Comportement attendu
Ordinaire Dossier unique, donnée complète Proposition correcte et sourcée
Ambigu Deux dossiers possibles Demande de clarification, aucune action
Incomplet Nouvelle adresse sans code postal Signaler l’information manquante
Contradictoire Message et pièce jointe divergent Présenter le conflit, ne pas trancher seul
Interdit Demande concernant un dossier inaccessible Refus sans révéler le contenu
Incident Outil métier indisponible État d’échec clair et reprise sans doublon

Réservez une partie des cas pour la validation finale. Si les mêmes exemples servent à corriger l’agent et à annoncer sa performance, vous mesurez surtout son adaptation à ces exemples.

3. Mesurer chaque dimension séparément

Une moyenne unique masque les erreurs importantes. Évaluez au minimum la réussite de la tâche, la fidélité aux sources, le respect des permissions, la qualité des paramètres d’action, le temps de traitement et l’effort de revue humaine.

Certaines mesures peuvent être automatiques : format valide, identifiant exact, absence d’appel interdit ou correspondance avec une valeur attendue. D’autres exigent une revue métier selon une grille explicite. Pour chaque critère, indiquez qui tranche les désaccords.

Une réponse élégante avec une mauvaise source reste un échec. De même, un taux global élevé ne compense pas une action non autorisée. Définissez des critères bloquants qui doivent rester à zéro sur le jeu prévu.

4. Tester la trajectoire, pas seulement la réponse finale

Un agent peut obtenir la bonne réponse par un chemin dangereux : lecture excessive, outil inadéquat, répétition d’une action ou utilisation d’une donnée non autorisée. Conservez les événements utiles à l’analyse sans recopier inutilement les contenus sensibles.

Vérifiez notamment :

  • les outils appelés et leurs paramètres ;
  • les contrôles d’autorisation réellement exécutés ;
  • les tentatives, délais et reprises ;
  • l’état présenté à l’utilisateur ;
  • l’approbation associée à une action sensible.

Le guide sur la sécurité et la gouvernance des agents IA aide à définir les permissions et les responsabilités correspondantes.

5. Comparer à une référence utile

Comparez l’agent au processus actuel ou à une solution plus simple : règle déterministe, recherche classique, modèle sans outil ou préparation manuelle. Utilisez les mêmes cas et la même définition de réussite.

Mesurez aussi l’effort total. Si l’agent réduit le temps de préparation mais double le temps de contrôle, le parcours complet peut ne pas s’améliorer. La valeur se juge sur le résultat validé, pas sur la vitesse de la première réponse.

6. Décider et surveiller

Avant le test, convenez des seuils pour lancer, corriger ou arrêter. Séparez les erreurs tolérables des événements bloquants. Documentez les échecs connus et le périmètre auquel les résultats s’appliquent.

Après le lancement, rejouez un échantillon stable à chaque changement significatif et surveillez les cas réels. Les données, les outils et le comportement du système évoluent ; une validation initiale n’est pas une garantie permanente.

Le guide du POC IA à la production permet d’intégrer ces résultats dans une décision de mise en service. Pour un copilote visible dans l’application, complétez avec les choix d’interface et de contrôle du guide concevoir un copilote IA métier.

Questions fréquentes

Combien de cas faut-il tester ?

Il n’existe pas de nombre universel. Cherchez d’abord à couvrir les variantes, les risques et les cas rares importants. Ajoutez des cas jusqu’à ce que les décisions soient stables sur le périmètre visé.

Peut-on confier toute l’évaluation à un autre modèle ?

Un modèle peut aider à trier ou comparer des sorties, mais il doit lui-même être vérifié sur des exemples notés par les personnes compétentes. Les critères sensibles et les actions réelles exigent des contrôles indépendants.

Que conserver après un test ?

Conservez la configuration, les identifiants de cas, les résultats, les décisions et les preuves nécessaires, avec des accès et une durée adaptés. Évitez de dupliquer les données personnelles ou confidentielles sans nécessité.

Des agents IA pour faire avancer vos opérations.

Reliez vos outils et vos processus avec des actions encadrées et des validations adaptées.