human data.Nous joindre

Nos référentiels

Preuves et raisonnement financiers

Évaluer les calculs financiers, les preuves sources et les hypothèses derrière les réponses des modèles.

Service
Développement de référentiels
Axe
Services financiers
Révision
Spécialistes du domaine
Demander le référentiel

Ce que nous évaluons

Nous évaluons si l’IA appuie ses conclusions financières sur des preuves sources, calcule avec exactitude et repère l’information manquante.

Portée des tâches

Tâches documentaires fondées sur des états financiers, des notes et des scénarios professionnels. Les évaluations utilisent des documents publics, sous licence ou créés pour l’occasion, ainsi que des documents autorisés par le client.

Méthodes d’évaluation

Ce que nous mesurons

  • Exactitude fondée sur les sources
  • Justesse des calculs
  • Divulgation des hypothèses
  • Traitement de l’information manquante

Révision par des spécialistes

Professionnels de la finance et de la comptabilité expérimentés dans l’interprétation des documents concernés. Les réviseurs conçoivent les tâches, affinent les critères de notation, évaluent les réponses et tranchent les désaccords.

Conception de l’évaluation

Nous documentons la sélection des tâches, les autorisations sur les données, les règles de notation et les paramètres des modèles avant l’évaluation. Une annotation pilote vérifie que les réviseurs appliquent les critères de façon cohérente. Les désaccords importants font l’objet d’une révision d’expert supplémentaire.

Rapports d’évaluation

Les rapports documentent les versions de modèles, les dates d’évaluation, les tailles d’échantillon, la performance et les limites. Nous fournissons les critères de notation et les documents à l’appui dans le respect des autorisations sur les données du projet.

Portée du référentiel

Les constats s’appliquent aux documents, aux tâches, aux versions de modèles et aux conditions testés. L’évaluation par référentiel appuie le développement de modèles; elle ne constitue ni un conseil en placement ni une certification pour la prise de décisions financières.

Les référentiels publics sur lesquels nous bâtissons

Résultats publiés pour des modèles à poids ouverts qui couvrent une partie de ce terrain. Notre référentiel ajoute la couche canadienne.

  • Finance Agent v2 (Vals AI) : 927 questions révisées par des spécialistes · 9 catégories de tâches · 75 modèles. Meilleur résultat à poids ouverts affiché : GLM 5.3 Flash, 57,85 %.
  • Westworld Finance Diligence Bench (Halluminate) : 88 tâches · 7 catégories (revue de diligence 22, documents de présentation 15, modélisation 14, souscription 13, préparation des données 11, qualité des résultats 9, clôture 4) · 8 modèles × 3 tentatives. Meilleur résultat à poids ouverts affiché : DeepSeek V4.1 Flash, 0,48.
  • SpreadsheetBench 2 (Zhu et coll., arXiv 2606.29955) : 321 tâches (100 modélisation financière, 100 débogage, 97 gabarit, 24 visualisation) · annotées par des spécialistes. Meilleur résultat à poids ouverts affiché : GLM-5, 17,14 %.

Des référentiels sur mesure pour vos systèmes d’IA

Testez la performance des modèles sur les tâches et les normes de votre secteur.

Discuter du développement de référentielsVoir nos référentiels