# Évaluer un agent IA : construire un plan de test fiable

Construisez un plan de test pour un agent IA : jeux de cas, critères de réussite, actions interdites, revue humaine et décision de mise en service.

Auteur: Binov

Publié le: 2026-10-02

Canonical: https://www.binov.com/fr/guides/evaluer-agent-ia-plan-test

Évaluer un agent IA consiste à vérifier son comportement sur des tâches et des risques définis, pas à collectionner quelques réponses convaincantes. Un plan fiable relie chaque cas à un résultat attendu, une conséquence d’erreur, une méthode de revue et un seuil de décision.

## 1. Définir ce qui est évalué

Fixez la version des instructions, des outils, du modèle, des sources et des règles métier. Sans cette configuration, un résultat ne peut pas être reproduit ni comparé. Précisez aussi le rôle de l’utilisateur et les permissions actives pendant le test.

Exemple fictif : un agent prépare un changement d’adresse à partir d’une demande client. Il doit vérifier l’identité, retrouver le dossier, extraire la nouvelle valeur et proposer la modification. L’évaluation ne porte donc pas seulement sur le texte produit, mais sur chaque étape et sur l’absence d’écriture avant validation.

| Élément | Version ou périmètre à consigner |
| --- | --- |
| Tâche | Entrée, sortie et étapes autorisées |
| Données | Échantillon, droits et date de référence |
| Outils | Interfaces, environnement et actions disponibles |
| Configuration IA | Modèle, instructions et paramètres utiles |
| Contrôles | Validations de code, approbations et arrêts |

## 2. Constituer un jeu de cas représentatif

Partez de situations réelles anonymisées lorsque vous avez le droit de les utiliser. Séparez les cas ordinaires, les limites, les exceptions et les tentatives interdites. Un jeu composé uniquement de demandes propres et complètes surestime la qualité en production.

| Famille | Exemple fictif | Comportement attendu |
| --- | --- | --- |
| Ordinaire | Dossier unique, donnée complète | Proposition correcte et sourcée |
| Ambigu | Deux dossiers possibles | Demande de clarification, aucune action |
| Incomplet | Nouvelle adresse sans code postal | Signaler l’information manquante |
| Contradictoire | Message et pièce jointe divergent | Présenter le conflit, ne pas trancher seul |
| Interdit | Demande concernant un dossier inaccessible | Refus sans révéler le contenu |
| Incident | Outil métier indisponible | État d’échec clair et reprise sans doublon |

Réservez une partie des cas pour la validation finale. Si les mêmes exemples servent à corriger l’agent et à annoncer sa performance, vous mesurez surtout son adaptation à ces exemples.

## 3. Mesurer chaque dimension séparément

Une moyenne unique masque les erreurs importantes. Évaluez au minimum la réussite de la tâche, la fidélité aux sources, le respect des permissions, la qualité des paramètres d’action, le temps de traitement et l’effort de revue humaine.

Certaines mesures peuvent être automatiques : format valide, identifiant exact, absence d’appel interdit ou correspondance avec une valeur attendue. D’autres exigent une revue métier selon une grille explicite. Pour chaque critère, indiquez qui tranche les désaccords.

Une réponse élégante avec une mauvaise source reste un échec. De même, un taux global élevé ne compense pas une action non autorisée. Définissez des critères bloquants qui doivent rester à zéro sur le jeu prévu.

## 4. Tester la trajectoire, pas seulement la réponse finale

Un agent peut obtenir la bonne réponse par un chemin dangereux : lecture excessive, outil inadéquat, répétition d’une action ou utilisation d’une donnée non autorisée. Conservez les événements utiles à l’analyse sans recopier inutilement les contenus sensibles.

Vérifiez notamment :

- les outils appelés et leurs paramètres ;
- les contrôles d’autorisation réellement exécutés ;
- les tentatives, délais et reprises ;
- l’état présenté à l’utilisateur ;
- l’approbation associée à une action sensible.

Le guide sur la [sécurité et la gouvernance des agents IA](/fr/guides/securite-gouvernance-agents-ia) aide à définir les permissions et les responsabilités correspondantes.

## 5. Comparer à une référence utile

Comparez l’agent au processus actuel ou à une solution plus simple : règle déterministe, recherche classique, modèle sans outil ou préparation manuelle. Utilisez les mêmes cas et la même définition de réussite.

Mesurez aussi l’effort total. Si l’agent réduit le temps de préparation mais double le temps de contrôle, le parcours complet peut ne pas s’améliorer. La valeur se juge sur le résultat validé, pas sur la vitesse de la première réponse.

## 6. Décider et surveiller

Avant le test, convenez des seuils pour lancer, corriger ou arrêter. Séparez les erreurs tolérables des événements bloquants. Documentez les échecs connus et le périmètre auquel les résultats s’appliquent.

Après le lancement, rejouez un échantillon stable à chaque changement significatif et surveillez les cas réels. Les données, les outils et le comportement du système évoluent ; une validation initiale n’est pas une garantie permanente.

Le guide [du POC IA à la production](/fr/guides/passer-poc-ia-production) permet d’intégrer ces résultats dans une décision de mise en service. Pour un copilote visible dans l’application, complétez avec les choix d’interface et de contrôle du guide [concevoir un copilote IA métier](/fr/guides/concevoir-copilote-ia-metier).

## Questions fréquentes

### Combien de cas faut-il tester ?

Il n’existe pas de nombre universel. Cherchez d’abord à couvrir les variantes, les risques et les cas rares importants. Ajoutez des cas jusqu’à ce que les décisions soient stables sur le périmètre visé.

### Peut-on confier toute l’évaluation à un autre modèle ?

Un modèle peut aider à trier ou comparer des sorties, mais il doit lui-même être vérifié sur des exemples notés par les personnes compétentes. Les critères sensibles et les actions réelles exigent des contrôles indépendants.

### Que conserver après un test ?

Conservez la configuration, les identifiants de cas, les résultats, les décisions et les preuves nécessaires, avec des accès et une durée adaptés. Évitez de dupliquer les données personnelles ou confidentielles sans nécessité.
