L’IA en services financiers, testée par des professionnels canadiens de la finance.
Référentiels de modèles ouverts, vérification diligente d’acquisition, modélisation financière et enquêtes sur la fraude, évalués en anglais et en français canadien par des CPA, des CFA et des praticiens bancaires.
Modèles à poids ouvertsRéférentiels publiésArbitrage par des spécialistes
Ce que nous évaluons
Cinq axes de travail, chacun avec un référentiel public comme point de départ et une couche canadienne ajoutée par nos spécialistes.
Référentiels de modèles ouverts
Des modèles à poids ouverts exécutés sur des tâches d’analyste canadiennes : documents déposés, divulgations, comparables et modélisation, notés par rapport à des réponses professionnelles dans les deux langues officielles.
Poids ouverts seulement
Bases publiées
EN · FR
Acquisition et vérification diligente
Qualité des résultats, souscription, rapprochement et clôture à partir de transactions canadiennes anonymisées. Les spécialistes notent la méthode, la concordance et la présentation.
Qualité des résultats
Rapprochement
Documents de transaction
Modélisation financière
Modèles à plusieurs feuilles, gabarits et tâches de débogage tirés de rapports financiers réels. Les récompenses vérifient les formules et les cellules cibles, pas l’apparence de la réponse.
Classeurs à plusieurs feuilles
Vérification des formules
Piste de vérification
Fraude et enquêtes
Étiquettes de transactions avec justification d’enquêteur, triage des alertes et évaluation de la façon dont un modèle explique un schéma suspect, y compris les faux positifs et les schémas manqués.
Triage des alertes
Justification d’enquêteur
Qualité des preuves
Service bilingue à la clientèle
Agents et assistants testés sur des produits canadiens avec des clients québécois : le même résultat, en français, avec la bonne terminologie et les bonnes divulgations.
Français québécois
Divulgations
Transfert
Les référentiels publics sur lesquels nous bâtissons
Nous partons des référentiels auxquels le milieu se fie déjà, limités aux modèles à poids ouverts que vous pouvez exécuter vous-même, puis nous ajoutons la couche canadienne : nos produits, nos règles, notre français. Les résultats sont présentés tels que publiés; ce ne sont pas des exécutions de Human Data.
Référentiel public
Finance Agent v2
Questions d’analyste débutant sur les documents déposés et les transcriptions de sociétés ouvertes : analyse des résultats, divulgations, ajustements, comparables, précédents et modélisation financière, avec outils de recherche et de calcul.
Publié par
Vals AI
Échelle
927 questions révisées par des spécialistes · 9 catégories de tâches · 75 modèles
Mesure
Exactitude (%) · coût par test (USD)
Modèle
Exactitude
Exactitude
Coût / test
GLM 5.3 FlashPoids ouvertsZ.ai · licence MIT
57,85 %
$0.05
MiMo V2.6 ProPoids ouvertsXiaomi · licence MIT
57,34 %
$0.20
MiMo V2.6 FlashPoids ouvertsXiaomi · licence MIT
56,28 %
$0.07
GLM 5.3Poids ouvertsZ.ai · poids ouverts
55,84 %
$1.07
DeepSeek V4.1 FlashPoids ouvertsDeepSeek · licence MIT
53,48 %
$0.21
Kimi K3Poids ouvertsMoonshot AI · MIT modifiée
53,11 %
$1.91
Qwen 3.8 27BPoids ouvertsAlibaba · Apache 2.0
48,55 %
$0.75
MiniMax-M3Poids ouvertsMiniMax · poids ouverts
48,27 %
$0.32
Référentiel public
Westworld Finance Diligence Bench
Un processus complet de vérification diligente d’acquisition sur des transactions privées anonymisées, exécuté dans des environnements de bureau avec des trajectoires de plusieurs centaines d’étapes. Chaque tâche a été rédigée et révisée par des professionnels des transactions en exercice.
Publié par
Halluminate
Échelle
88 tâches · 7 catégories (revue de diligence 22, documents de présentation 15, modélisation 14, souscription 13, préparation des données 11, qualité des résultats 9, clôture 4) · 8 modèles × 3 tentatives
Mesure
Score moyen de 0 à 1 dans un harnais CLI natif / dans un harnais d’utilisation d’ordinateur
Modèle
CLI natif
CLI natif
Utilisation d’ordinateur
Claude Opus 5.5Anthropic
0,59
0,59
Claude Fable 5.1Anthropic
0,56
0,58
GPT-6.1 SolOpenAI
0,54
0,55
GPT-6 AstraOpenAI
0,53
0,54
Gemini 3.8 FlashGoogle
0,50
0,45
DeepSeek V4.1 FlashPoids ouvertsDeepSeek · licence MIT
0,48
0,40
Grok 4.7xAI
0,47
0,30
Muse Spark 1.3Meta
0,45
0,26
Référentiel public
SpreadsheetBench 2
Flux de travail complets sur tableurs d’entreprise construits à partir de rapports financiers et de documents réglementaires réels : modélisation financière, gabarits, débogage et visualisation, avec 11,8 feuilles en moyenne.
Publié par
Zhu et coll., arXiv 2606.29955
Échelle
321 tâches (100 modélisation financière, 100 débogage, 97 gabarit, 24 visualisation) · annotées par des spécialistes
Mesure
Exactitude globale (%) · exactitude en modélisation financière (%)
Agents textuels qui résolvent des tâches de service à la clientèle bancaire sur une base de connaissances d’environ 700 documents, avec un client simulé et une politique à respecter.
Publié par
Sierra
Échelle
27 modèles · domaine bancaire de τ-bench
Mesure
pass@1 (%)
Modèle
pass@1
pass@1
Kimi K3Poids ouvertsMoonshot AI · MIT modifiée · tous les outils, raisonnement étendu
37,1 %
GLM-5.2Poids ouvertsZ.ai · licence MIT · tous les outils, raisonnement étendu
37,1 %
InklingPoids ouvertsThinking Machines · Apache 2.0 · tous les outils, raisonnement étendu
25 %
GLM-5Poids ouvertsZ.ai · licence MIT · recherche par plongements, sans raisonnement étendu
9,8 %
Qwen3.5-397B-A17BPoids ouvertsAlibaba · Apache 2.0 · recherche par plongements, sans raisonnement étendu
9,8 %
Fraude : des jeux de données étiquetés, puis le jugement d’enquêteurs
Les jeux de données publics sur la fraude donnent une étiquette par transaction. Les enquêtes exigent davantage : le schéma, les preuves et les raisons pour lesquelles une personne escaladerait ou classerait le dossier. Nos spécialistes ajoutent cette couche et évaluent la façon dont un modèle explique sa décision.
590 540transactions sans carte présente
IEEE-CIS Fraud Detection
3,5 % de fraude (20 663 cas), 431 variables, six mois d’activité.
Vesta · Kaggle, 20196,3 Mtransactions simulées d’argent mobile
PaySim
0,13 % de fraude (8 213 cas) sur une simulation de 30 jours.
Lopez-Rojas et coll., 2016284 807transactions par carte, deux jours
Fraude par carte de crédit (ULB)
492 fraudes (0,172 %), 28 composantes anonymisées plus le temps et le montant.
Université Libre de Bruxelles · Worldline
Où les modèles échouent en finance
Analyse des échecs tirée du Westworld Finance Diligence Bench, 88 tâches de vérification diligente sur huit modèles. Ce sont les catégories que nos grilles sont conçues pour détecter.
Erreurs de raisonnement financier
Mauvaise méthode d’analyse
22,1 %
Travail juste, mauvaise présentation
19,6 %
Échec de rapprochement et de concordance
13,7 %
Copié au lieu de dérivé
11,8 %
Erreurs sur longs horizons
Clôture prématurée de la découverte
22,1 %
Échec de la mécanique de livraison
14,9 %
Fausse vérification
14,7 %
Perte des consignes au fil de l’horizon
14,5 %
Publié par Halluminate dans le Westworld Finance Diligence Bench. Part des échecs par catégorie sur l’ensemble des exécutions.
Environnements RL au Canada
Des environnements RL pour les services financiers
Des tâches bancaires canadiennes simulées où un modèle agit et où une récompense rédigée par des spécialistes note ce qu’il a fait. Les mêmes environnements entraînent un modèle et évaluent celui que vous exploitez déjà.
Tâches
Transferts entre comptes enregistrés : CELI, REER, CELIAPP, REEE
Renouvellement hypothécaire et décisions de garantie de taux
Contestations de cartes et rétrofacturations
Vérification de l’identité des clients et des bénéficiaires effectifs
Paiements de factures et jumelage des bénéficiaires pour les membres de caisses
Triage des alertes de fraude avec escalade vers un enquêteur
Récompenses
Vérifications exactes : type de compte, montant, bénéficiaire, date
Consentement recueilli avant tout mouvement d’argent
Divulgations livrées dans la langue du client
Limites des politiques respectées; demandes hors cadre transférées à une personne
Grille de spécialistes pour la qualité des explications, calibrée avant usage
Tester les agents qui agissent pour les clientsServices bancaires
Transférez 2 000 $ dans mon CELI avant vendredi.
C’est fait. 2 000 $ transférés.
DemandéCELI
FaitREER
Signalé par les évaluateurs de Human Data : mauvais compte enregistré.Les droits de cotisation et le traitement fiscal diffèrent. Le transfert ne peut pas être annulé sans retrait.
1 / 3
Les caisses et les technologies financières obtiennent les mêmes environnements avec leurs propres produits, limites et interfaces de fournisseurs. Les environnements sont livrés prêts à l’emploi dans votre pile d’entraînement, ou exécutés par nous pour l’évaluation.