Tâches représentatives
Définir le travail professionnel, les documents sources et les conditions d’exploitation couverts par chaque évaluation.
Nous concevons des tests dirigés par des spécialistes pour mesurer la performance de l’IA sur des tâches professionnelles.
Explorer nos référentielsDes évaluations conçues par des spécialistes en langue, en raisonnement financier et en tâches industrielles.
Évaluer le sens, la terminologie et les preuves en anglais et en français canadiens.
Évaluer les calculs financiers, les preuves sources et les hypothèses derrière les réponses des modèles.
Tester la façon dont l’IA respecte les contraintes techniques, reconnaît les défaillances et fait appel aux experts humains.
Nous bâtissons des tests autour de tâches d’entreprise, définissons des critères de notation et faisons appel à des spécialistes du domaine pour évaluer la performance des modèles.
Définir le travail professionnel, les documents sources et les conditions d’exploitation couverts par chaque évaluation.
Préciser les critères d’exactitude, de preuves, d’exhaustivité et propres au domaine.
Tester la cohérence de la notation, évaluer l’accord entre réviseurs et trancher les désaccords importants.
Documenter les versions de modèles, les paramètres de test, les tailles d’échantillon, les scores et les limites de l’évaluation.
Classements publiés pour les modèles à poids ouverts, tels que rapportés par leurs auteurs. Nos référentiels canadiens ajoutent les produits, les règles et le français qu’ils ne couvrent pas.
Vals AI
Questions d’analyste débutant sur les documents déposés et les transcriptions de sociétés ouvertes : analyse des résultats, divulgations, ajustements, comparables, précédents et modélisation financière, avec outils de recherche et de calcul.
Halluminate
Un processus complet de vérification diligente d’acquisition sur des transactions privées anonymisées, exécuté dans des environnements de bureau avec des trajectoires de plusieurs centaines d’étapes. Chaque tâche a été rédigée et révisée par des professionnels des transactions en exercice.
Zhu et coll., arXiv 2606.29955
Flux de travail complets sur tableurs d’entreprise construits à partir de rapports financiers et de documents réglementaires réels : modélisation financière, gabarits, débogage et visualisation, avec 11,8 feuilles en moyenne.
Sierra
Agents textuels qui résolvent des tâches de service à la clientèle bancaire sur une base de connaissances d’environ 700 documents, avec un client simulé et une politique à respecter.
Snorkel AI, arXiv 2602.00456
Souscription en assurance commerciale de dommages : appétit, admissibilité, limites et franchises, recommandation de produits, classification d’entreprises et admissibilité des petites entreprises, avec outils SQL et consultation de lignes directrices sur une base de données et des règles d’affaires propriétaires.
Beauchemin & Khoury, Université Laval, arXiv 2603.07825
807 questions à choix multiples en français, numérisées à partir des manuels de certification des représentants en assurance du Québec, en droit civil québécois.
GRAAL, Université Laval, arXiv 2510.05046
23 tâches de compréhension du français, dont la grammaire du français québécois, les expressions régionales et la désambiguïsation lexicale.
Testez la performance des modèles sur les tâches et les normes de votre secteur.