Lire un benchmark d’IA avant de choisir un modèle

Lire un benchmark d’IA avec ses conditions de test et le coût par résultat utile. Construire une petite comparaison qui compte aussi erreurs, corrections et temps de contrôle.

Publication originale · · JKook · Traduction mise à jour · Lire l’original en anglais

Rangées d'armoires serveurs formant le supercalculateur Pleiades au centre de recherche Ames de la NASA.
Le supercalculateur Pleiades de la NASA au centre de recherche Ames, photographié le 8 octobre 2008. Image d'archives de recherche informatique. Illustre l'infrastructure informatique ; elle ne représente pas les modèles d'IA ni les tests de performance abordés dans l'article. Marco Librero / NASA Ames Research Center, via Wikimedia Commons · Public domain — U.S. government work (NASA) · Crédits et licences des images

Un classement simplifie un choix complexe. Trouvez le meilleur score, choisissez le modèle correspondant et passez à la suite. La difficulté réapparaît dès la première tâche concrète : un document mal formaté, des instructions ambiguës ou une date limite. C’est par là que je commencerais la comparaison : par le travail restant à accomplir et une description claire du résultat attendu.

Ce que mesure réellement le score

Un benchmark est un ensemble défini de tâches et une méthode d’évaluation des réponses. Son intérêt réside dans la reproductibilité de la comparaison. Un modèle performant sur ces tâches a démontré son utilité dans ces conditions. La question suivante est de savoir dans quelle mesure ces conditions ressemblent à celles qui vous intéressent.

Les recherches initiales de Stanford sur HELM, présentées en 2022, préconisaient l’évaluation des modèles de langage dans différents scénarios et selon de multiples mesures. La précision n’était qu’un aspect de cette approche ; l’efficacité, la robustesse et d’autres propriétés étaient également importantes. Ces recherches plus anciennes sont utiles ici pour leur méthode, et non comme un classement actuel des produits.

Faites en sorte que le test ressemble à un mardi ordinaire.

Supposons que vous souhaitiez obtenir de l'aide pour transformer les messages clients en une liste hebdomadaire des problèmes récurrents. Un questionnaire de connaissances générales ne vous apprendrait pas grand-chose sur la capacité d'un système à préserver le sens d'une réclamation, à gérer une phrase ambiguë ou à éviter d'interpréter les intentions du client. Votre propre essai pourrait utiliser un petit ensemble d'exemples non confidentiels, les catégories attendues étant préalablement notées.

Incluez un exemple simple, un exemple complexe et un cas où la bonne réponse consiste à demander des précisions. Conservez les mêmes instructions et les mêmes ressources pour chaque modèle. Cela ne permettra pas d'établir un diagnostic définitif pour chaque utilisation possible, mais cela peut révéler une inadéquation avant même de concevoir un flux de travail.

Chronométrez le temps passé à corriger la réponse.

Prenons l'exemple d'un essai illustratif portant sur dix courts résumés. Le système A prend dix minutes à s'exécuter et vingt minutes à vérifier et à corriger. Le système B prend quinze minutes à exécuter et cinq minutes à vérifier. Si les deux systèmes donnent des résultats acceptables, le temps de travail total est de trente minutes pour le système A et de vingt minutes pour le système B. La rapidité de la première réponse n'a pas permis d'obtenir un résultat final plus rapide.

C'est le principe du coût par résultat utile. Ce coût peut inclure les frais d'abonnement, le temps d'attente, les vérifications et les conséquences d'une erreur. Ces chiffres hypothétiques ne correspondent à aucune mesure de produit spécifique. Ils illustrent pourquoi une légère différence dans un score public peut avoir moins d'importance qu'un problème récurrent dans votre processus.

Une réponse fluide nécessite toujours des preuves.

L'étalonnage décrit la concordance entre le niveau de confiance exprimé par un système et son exactitude. Pour le lecteur, l'enjeu pratique est de savoir si l'incertitude est clairement mise en évidence lorsque les preuves sont faibles. Une réponse fournissant un chiffre sans justification peut être plus difficile à utiliser qu'une réponse identifiant une donnée manquante.

Le cadre de gestion des risques liés à l'IA du NIST, basé sur le volontariat, intègre l'évaluation dans la problématique plus large de l'utilisation d'un système et des risques associés. J'en tire une leçon importante : décider à l'avance des résultats nécessitant une vérification indépendante, des informations à exclure de l'outil et des conditions justifiant l'arrêt de son utilisation pour une tâche donnée.

Conservez une trace écrite de votre décision.

Enregistrez la version du modèle, la date du test, les instructions et quelques résultats représentatifs. Revenez sur votre décision lorsque le produit ou votre travail évolue de manière significative. Un exemple enregistré est souvent plus instructif qu'un simple souvenir, comme celui d'un assistant qui se sentait mieux il y a plusieurs mois.

Je privilégie une liste restreinte de candidats, étayée par une période d'essai transparente. Le classement peut vous aider à identifier des candidats. Le choix final doit reposer sur la capacité de l'outil à vous aider efficacement à mener à bien votre travail.

Choisir selon le travail à accomplir

Comparer les modèles sur des tâches représentatives, dans les mêmes conditions, et prendre en compte le temps de révision ainsi que la rapidité de réponse.

Un score plus élevé au test de performance signifie-t-il qu'un modèle sera plus adapté à mon travail ?

Ce score témoigne des tâches et des conditions du test. Testez des exemples représentatifs de votre propre flux de travail avant de le considérer comme une réponse générale.

Sources

Sources vérifiées ·

Participer à la discussion

Les commentaires sont affichés après examen et validation. Les désaccords argumentés sont les bienvenus.

À propos et principes