Benchmark des pipelines
Le benchmark permet à un manager de comparer plusieurs pipelines (ou variantes de modèles IA) sur un même document de test, en s'appuyant sur des annotations attendues définies à l'avance — sans produire de document annoté final, seule la qualité des annotations compte.
Mettre en place un benchmark
- Téléversez un document de test (et ses documents supports éventuels) et définissez la vérité terrain : la liste des annotations attendues (commentaire, et éventuellement une note associée).
- Ajoutez un ou plusieurs items à comparer : chaque item est un pipeline (portfolio) donné, avec la possibilité de surcharger le modèle IA utilisé par tel ou tel nœud (Agent ou Superviseur) sans modifier le pipeline lui-même — c'est ainsi qu'on compare, par exemple, le même pipeline avec deux fournisseurs de modèle différents.
- Chaque item est exécuté comme une analyse réelle (même moteur, même exécuteur de pipeline), catégorisée séparément des jobs normaux pour ne pas fausser les statistiques de production.
Évaluation
Un modèle IA « juge » (le modèle par défaut de l'organisation) compare chaque annotation attendue aux annotations effectivement produites, par le sens du commentaire, pas par correspondance exacte de texte. Le rapport de chaque item indique :
- Tokens consommés (entrée/sortie/total) et temps d'exécution.
- Nombre d'annotations attendues retrouvées, en doublon, ou superflues (« extras » — trouvées mais ne correspondant à rien d'attendu).
- Un pourcentage de précision (annotations attendues correctement retrouvées / total attendu).
Ces résultats permettent de choisir objectivement, avant mise en production, la combinaison pipeline/modèle offrant le meilleur rapport précision/coût/temps.