human data.Nous joindre

Des référentiels d’IA pour
les applications d’entreprise

Nous concevons des tests dirigés par des spécialistes pour mesurer la performance de l’IA sur des tâches professionnelles.

Explorer nos référentiels
Tâches réellesGrilles d’expertsMéthodes transparentes

Nos référentiels

Des évaluations conçues par des spécialistes en langue, en raisonnement financier et en tâches industrielles.

Conception des référentiels
et tests de modèles

Nous bâtissons des tests autour de tâches d’entreprise, définissons des critères de notation et faisons appel à des spécialistes du domaine pour évaluer la performance des modèles.

Tâches représentatives

Définir le travail professionnel, les documents sources et les conditions d’exploitation couverts par chaque évaluation.

Grilles conçues par des spécialistes

Préciser les critères d’exactitude, de preuves, d’exhaustivité et propres au domaine.

Révision humaine calibrée

Tester la cohérence de la notation, évaluer l’accord entre réviseurs et trancher les désaccords importants.

Rapports reproductibles

Documenter les versions de modèles, les paramètres de test, les tailles d’échantillon, les scores et les limites de l’évaluation.

Les référentiels publics
sur lesquels nous bâtissons

Classements publiés pour les modèles à poids ouverts, tels que rapportés par leurs auteurs. Nos référentiels canadiens ajoutent les produits, les règles et le français qu’ils ne couvrent pas.

Vals AI

Finance Agent v2

Questions d’analyste débutant sur les documents déposés et les transcriptions de sociétés ouvertes : analyse des résultats, divulgations, ajustements, comparables, précédents et modélisation financière, avec outils de recherche et de calcul.

Échelle
927 questions révisées par des spécialistes · 9 catégories de tâches · 75 modèles
Meilleur résultat à poids ouverts affiché
GLM 5.3 Flash : 57,85 %
Voir les résultats

Halluminate

Westworld Finance Diligence Bench

Un processus complet de vérification diligente d’acquisition sur des transactions privées anonymisées, exécuté dans des environnements de bureau avec des trajectoires de plusieurs centaines d’étapes. Chaque tâche a été rédigée et révisée par des professionnels des transactions en exercice.

Échelle
88 tâches · 7 catégories (revue de diligence 22, documents de présentation 15, modélisation 14, souscription 13, préparation des données 11, qualité des résultats 9, clôture 4) · 8 modèles × 3 tentatives
Meilleur résultat à poids ouverts affiché
DeepSeek V4.1 Flash : 0,48
Voir les résultats

Zhu et coll., arXiv 2606.29955

SpreadsheetBench 2

Flux de travail complets sur tableurs d’entreprise construits à partir de rapports financiers et de documents réglementaires réels : modélisation financière, gabarits, débogage et visualisation, avec 11,8 feuilles en moyenne.

Échelle
321 tâches (100 modélisation financière, 100 débogage, 97 gabarit, 24 visualisation) · annotées par des spécialistes
Meilleur résultat à poids ouverts affiché
GLM-5 : 17,14 %
Voir les résultats

Sierra

τ³-Banking

Agents textuels qui résolvent des tâches de service à la clientèle bancaire sur une base de connaissances d’environ 700 documents, avec un client simulé et une politique à respecter.

Échelle
27 modèles · domaine bancaire de τ-bench
Meilleur résultat à poids ouverts affiché
Kimi K3 : 37,1 %
Voir les résultats

Snorkel AI, arXiv 2602.00456

Underwrite

Souscription en assurance commerciale de dommages : appétit, admissibilité, limites et franchises, recommandation de produits, classification d’entreprises et admissibilité des petites entreprises, avec outils SQL et consultation de lignes directrices sur une base de données et des règles d’affaires propriétaires.

Échelle
300 tâches à plusieurs tours issues de 3 000 profils de demandeurs synthétisés · 13 modèles
Meilleur résultat à poids ouverts affiché
DeepSeek V3.1 : 73,7 %
Voir les résultats

Beauchemin & Khoury, Université Laval, arXiv 2603.07825

AEPC-QA · certification en assurance du Québec

807 questions à choix multiples en français, numérisées à partir des manuels de certification des représentants en assurance du Québec, en droit civil québécois.

Échelle
807 questions · 51 modèles · livre fermé et avec recherche documentaire
Meilleur résultat à poids ouverts affiché
DeepSeek-R1 (deepseek-reasoner) : 36,3 %
Voir les résultats

GRAAL, Université Laval, arXiv 2510.05046

COLE · compréhension du français québécois

23 tâches de compréhension du français, dont la grammaire du français québécois, les expressions régionales et la désambiguïsation lexicale.

Échelle
23 tâches · 95 modèles
Meilleur résultat à poids ouverts affiché
DeepSeek-V3 (deepseek-chat) : 65,2 %
Voir les résultats

Des référentiels sur mesure pour
vos systèmes d’IA

Testez la performance des modèles sur les tâches et les normes de votre secteur.