Comment savoir si votre système d'IA est réellement bon

La plupart des équipes évaluent l'IA en l'essayant quelques fois et en étant impressionnées. Voici à quoi ressemble une vraie mesure.

Motifs de circuits représentant un système d'IA

Les fonctionnalités IA ont ceci de particulier qu'elles paraissent généralement bonnes en démonstration et échouent d'une manière que personne ne remarque. Un logiciel classique fonctionne ou renvoie une erreur ; un modèle produit une réponse fluide et assurée, qu'elle soit correcte ou non. Sans mesure, vous ignorez laquelle vous livrez.

Constituez le jeu d'évaluation d'abord

Cinquante entrées réelles avec le résultat attendu, collectées avant de construire. Réelles signifie issues de vrais utilisateurs ou de vrais documents, cas pénibles compris. Un jeu assemblé à partir des cas que votre système traite bien est un exercice de réassurance, pas un test.

Séparez les deux défaillances

  1. La récupération : la bonne matière source est-elle revenue ? Mesurez-la indépendamment, car un échec de génération et un échec de récupération se ressemblent de l'extérieur et exigent des correctifs opposés.
  2. La génération : à partir de la bonne matière, la réponse était-elle correcte, complète et convenablement nuancée ?

Les métriques trompeuses

  • La satisfaction utilisateur seule. Les gens notent bien les réponses fluides indépendamment de leur exactitude ; l'assurance se lit comme de la compétence.
  • Les moyennes. Une seule réponse catastrophique inventant une règle compte plus que cinquante réponses médiocres, et une moyenne la masque parfaitement.
  • Les scores de référence du modèle sous-jacent. Ils ne disent rien de vos documents, de vos utilisateurs ni de vos prompts.
  • Le volume d'utilisation. L'adoption mesure la curiosité au premier mois et l'habitude au sixième ; seul le second signifie quelque chose.

Détecter les régressions

Exécutez le jeu d'évaluation à chaque modification de prompt et à chaque mise à jour de modèle. Les fournisseurs déprécient et actualisent leurs modèles, et le comportement change sans que votre code bouge. Sans contrôle automatisé, vous l'apprenez d'un client, la façon la plus coûteuse possible de le découvrir. C'est aussi ainsi que nous cadrons une mission d'intégration d'IA : le jeu d'évaluation d'abord, le modèle ensuite.

  • 50 cas réels dans un jeu d'évaluation
  • 2 types de défaillance, mesurés séparément
  • chaque changement de prompt ou de modèle réévalué

Questions fréquentes

Un modèle peut-il évaluer la sortie d'un autre modèle ?

Oui, et cela passe bien à l'échelle pour un premier tri — mais il hérite de angles morts et tend à récompenser la fluidité. Utilisez-le pour la largeur, et gardez un sous-ensemble relu par un humain comme référence pour contrôler le juge lui-même.

À quelle fréquence réévaluer ?

À chaque modification, et périodiquement de toute façon — mensuellement est raisonnable. Le comportement des modèles dérive sous vos pieds, et tout l'intérêt du jeu d'évaluation est que vous l'appreniez avant vos utilisateurs.

Sur le même thème: Intelligence Artificielle.

À lire ensuite

Vous voulez la même chose pour votre entreprise ? Voir ce que nous faisons.