Ce que nous évaluons
Nous évaluons si l’IA appuie ses conclusions financières sur des preuves sources, calcule avec exactitude et repère l’information manquante.
Portée des tâches
Tâches documentaires fondées sur des états financiers, des notes et des scénarios professionnels. Les évaluations utilisent des documents publics, sous licence ou créés pour l’occasion, ainsi que des documents autorisés par le client.
Méthodes d’évaluation
Ce que nous mesurons
- Exactitude fondée sur les sources
- Justesse des calculs
- Divulgation des hypothèses
- Traitement de l’information manquante
Révision par des spécialistes
Professionnels de la finance et de la comptabilité expérimentés dans l’interprétation des documents concernés. Les réviseurs conçoivent les tâches, affinent les critères de notation, évaluent les réponses et tranchent les désaccords.
Conception de l’évaluation
Nous documentons la sélection des tâches, les autorisations sur les données, les règles de notation et les paramètres des modèles avant l’évaluation. Une annotation pilote vérifie que les réviseurs appliquent les critères de façon cohérente. Les désaccords importants font l’objet d’une révision d’expert supplémentaire.
Rapports d’évaluation
Les rapports documentent les versions de modèles, les dates d’évaluation, les tailles d’échantillon, la performance et les limites. Nous fournissons les critères de notation et les documents à l’appui dans le respect des autorisations sur les données du projet.
Portée du référentiel
Les constats s’appliquent aux documents, aux tâches, aux versions de modèles et aux conditions testés. L’évaluation par référentiel appuie le développement de modèles; elle ne constitue ni un conseil en placement ni une certification pour la prise de décisions financières.
Les référentiels publics sur lesquels nous bâtissons
Résultats publiés pour des modèles à poids ouverts qui couvrent une partie de ce terrain. Notre référentiel ajoute la couche canadienne.
- Finance Agent v2 (Vals AI) : 927 questions révisées par des spécialistes · 9 catégories de tâches · 75 modèles. Meilleur résultat à poids ouverts affiché : GLM 5.3 Flash, 57,85 %.
- Westworld Finance Diligence Bench (Halluminate) : 88 tâches · 7 catégories (revue de diligence 22, documents de présentation 15, modélisation 14, souscription 13, préparation des données 11, qualité des résultats 9, clôture 4) · 8 modèles × 3 tentatives. Meilleur résultat à poids ouverts affiché : DeepSeek V4.1 Flash, 0,48.
- SpreadsheetBench 2 (Zhu et coll., arXiv 2606.29955) : 321 tâches (100 modélisation financière, 100 débogage, 97 gabarit, 24 visualisation) · annotées par des spécialistes. Meilleur résultat à poids ouverts affiché : GLM-5, 17,14 %.
Des référentiels sur mesure pour vos systèmes d’IA
Testez la performance des modèles sur les tâches et les normes de votre secteur.
Discuter du développement de référentielsVoir nos référentiels