Ce que nous évaluons
Nous évaluons le raisonnement de l’IA dans des tâches de maintenance et d’automatisation, dont le respect des contraintes, la reconnaissance des défaillances et les décisions qui exigent une intervention humaine.
Portée des tâches
Scénarios textuels de maintenance et d’automatisation avec contraintes d’exploitation, exigences de tâche et critères d’escalade documentés.
Méthodes d’évaluation
Ce que nous mesurons
- Respect des contraintes
- Exhaustivité des tâches
- Reconnaissance des défaillances
- Escalade appropriée
Révision par des spécialistes
Ingénieurs, spécialistes de l’automatisation et réviseurs techniques expérimentés. Les réviseurs conçoivent les tâches, affinent les critères de notation, évaluent les réponses et tranchent les désaccords.
Conception de l’évaluation
Nous documentons la sélection des tâches, les autorisations sur les données, les règles de notation et les paramètres des modèles avant l’évaluation. Une annotation pilote vérifie que les réviseurs appliquent les critères de façon cohérente. Les désaccords importants font l’objet d’une révision d’expert supplémentaire.
Rapports d’évaluation
Les rapports documentent les versions de modèles, les dates d’évaluation, les tailles d’échantillon, la performance et les limites. Nous fournissons les critères de notation et les documents à l’appui dans le respect des autorisations sur les données du projet.
Portée du référentiel
Ce référentiel évalue le raisonnement dans des scénarios documentés. La validation des systèmes physiques et l’assurance de la sécurité propre au domaine exigent des essais distincts.
Les référentiels publics sur lesquels nous bâtissons
Résultats publiés pour des modèles à poids ouverts qui couvrent une partie de ce terrain. Notre référentiel ajoute la couche canadienne.
- τ³-Banking (Sierra) : 27 modèles · domaine bancaire de τ-bench. Meilleur résultat à poids ouverts affiché : Kimi K3, 37,1 %.
- Underwrite (Snorkel AI, arXiv 2602.00456) : 300 tâches à plusieurs tours issues de 3 000 profils de demandeurs synthétisés · 13 modèles. Meilleur résultat à poids ouverts affiché : DeepSeek V3.1, 73,7 %.
Des référentiels sur mesure pour vos systèmes d’IA
Testez la performance des modèles sur les tâches et les normes de votre secteur.
Discuter du développement de référentielsVoir nos référentiels