Mesurer un agent IA : les 6 indicateurs | Rakam AI

Mesurer un agent IA · Mis à jour le 2026-10-06

Mesurer l'efficacité d'un agent IA, avant et après la production

Un agent IA se mesure sur un jeu de cas réels, préparé avant de le construire, et sur six indicateurs : la justesse des outils appelés, la fidélité aux sources, la cohérence, le taux d'escalade, le coût par action et l'indicateur métier qu'il doit déplacer. Une démonstration réussie n'en mesure aucun.

Pourquoi mesurer un agent autrement qu’un chatbot ?

Un chatbot se juge sur la pertinence d’une réponse. Un agent se juge sur la justesse d’une action, parce qu’il écrit dans votre logiciel. Une action fausse ne se corrige pas en relisant : elle se corrige dans la base.

Il faut donc mesurer ce que l’agent fait, pas seulement ce qu’il dit. Et le mesurer avant la production, sur des cas dont on connaît la bonne réponse, puis après, sur ce qui se passe réellement.

Comment construire un jeu d’évaluation ?

C’est la première étape d’un projet, avant le modèle et avant le code. Le jeu d’évaluation est une liste de cas réels, chacun avec le résultat attendu, produite avec les experts métier :

  • les cas courants, ceux qui font le volume ;
  • les cas ambigus, ceux qui décident si l’agent est utilisable ;
  • les cas hors périmètre, où la bonne réponse est de refuser ou de passer la main.

Le jeu de test est séparé de ce qui sert à configurer l’agent. Sinon on mesure sa mémoire, pas sa justesse. La méthode complète est dans comment créer un agent IA.

Quels indicateurs suivre ?

Six indicateurs couvrent l’essentiel. Les quatre premiers se mesurent sur le jeu d’évaluation, les deux derniers en production.

IndicateurCe qu’il mesure
Précision des appels d’outilsL’agent a-t-il appelé le bon outil, avec les bons paramètres ?
FidélitéLa réponse s’appuie-t-elle sur les sources, sans rien inventer ?
CohérenceLa même question donne-t-elle la même réponse ?
Taux d’escaladeQuelle part des demandes l’agent passe-t-il à un humain, et à raison ?
Coût par actionCombien coûte une action réussie, appels au modèle compris ?
Indicateur métierCe que l’agent doit déplacer : tickets, délais, heures, revenu

Le taux d’escalade se lit dans les deux sens. Trop bas, l’agent prend des décisions qu’il ne devrait pas prendre. Trop haut, il ne rend pas le service attendu. La cible se fixe par usage, sur le coût d’une erreur.

À quoi ressemblent ces mesures sur un projet livré ?

Chez OOTI, éditeur d’un ERP pour les cabinets d’architecture, l’agent transforme les questions en langage naturel en requêtes sur les données de l’ERP. Les mesures publiées :

  • 92 % de précision des appels d’outils ;
  • 97 % de score de fidélité ;
  • 100 % de cohérence des réponses ;
  • moins de 0,10 $ par question.

Chaque chiffre répond à une question différente. La précision des outils dit si l’agent interroge les bonnes données. La fidélité dit s’il rapporte ce qu’il a trouvé sans l’embellir. La cohérence dit qu’un associé et un chef de projet qui posent la même question obtiennent le même chiffre. Le coût dit si l’usage est tenable à l’échelle. Le détail est sur la fiche client.

Comment comparer deux configurations ?

Sur le même jeu de test, avec le même protocole, en publiant l’écart. Chez VAL Software, le matching CV-emploi a gagné 17 points de précision par la comparaison de 28 configurations sur le même jeu de test. Sans protocole commun, on aurait comparé des impressions.

Le système est livré avec plus de 109 tests, ce qui permet de vérifier qu’une amélioration à un endroit n’a rien cassé ailleurs.

Que mesurer une fois en production ?

Ce que le jeu d’évaluation ne voit pas : les questions que personne n’avait prévues, la dérive quand votre logiciel change, le coût réel à l’usage. Le journal de chaque action sert ici de matière première. Une erreur trouvée en production devient un cas de plus dans le jeu d’évaluation, et la mesure suivante la couvre.

Et l’indicateur métier, celui qui justifie le prix. C’est lui qui permet de facturer au résultat plutôt qu’à la licence, comme l’explique le modèle à crédits. Si vous voulez savoir par où commencer sur votre propre logiciel, le scan ci-dessous donne un premier diagnostic.

Questions fréquentes

Assez pour couvrir les familles de questions réelles, y compris les cas ambigus et ceux où l'agent doit refuser ou passer la main. Le nombre dépend de la variété de l'activité. Ce qui compte plus que le volume : des cas produits par vos experts métier, avec le résultat attendu écrit avant le test.

Oui, pour la fidélité et la pertinence, à condition de vérifier la notation sur un échantillon noté à la main. Pour la justesse des appels d'outils, une comparaison directe avec l'appel attendu est plus fiable : le bon outil, avec les bons paramètres, ou non.

À chaque changement : de modèle, de prompt, de graphe, de version de votre logiciel. Un jeu de test automatisé se relance en quelques minutes. C'est ce qui permet de changer de modèle sans crainte, et de prouver qu'une modification n'a rien dégradé ailleurs.

L'indicateur métier, avec la façon dont il a été mesuré. Un client n'achète pas une précision d'outil, il achète des tickets évités, des dossiers traités, des heures rendues. Les indicateurs techniques servent à garantir que ce chiffre tient dans la durée.

Newsletter

Chaque mois, ce qui marche vraiment en IA pour les éditeurs.

Des cas, des chiffres, des modèles économiques. Un e-mail, pas plus.

Demander une démo

Quinze minutes pour voir un agent IA travailler dans un logiciel comme le vôtre.