human data.Nous joindre

Services financiers

L’IA en services financiers, testée par des professionnels canadiens de la finance.

Référentiels de modèles ouverts, vérification diligente d’acquisition, modélisation financière et enquêtes sur la fraude, évalués en anglais et en français canadien par des CPA, des CFA et des praticiens bancaires.

Modèles à poids ouvertsRéférentiels publiésArbitrage par des spécialistes

Ce que nous évaluons

Cinq axes de travail, chacun avec un référentiel public comme point de départ et une couche canadienne ajoutée par nos spécialistes.

Référentiels de modèles ouverts

Des modèles à poids ouverts exécutés sur des tâches d’analyste canadiennes : documents déposés, divulgations, comparables et modélisation, notés par rapport à des réponses professionnelles dans les deux langues officielles.

  • Poids ouverts seulement
  • Bases publiées
  • EN · FR

Acquisition et vérification diligente

Qualité des résultats, souscription, rapprochement et clôture à partir de transactions canadiennes anonymisées. Les spécialistes notent la méthode, la concordance et la présentation.

  • Qualité des résultats
  • Rapprochement
  • Documents de transaction

Modélisation financière

Modèles à plusieurs feuilles, gabarits et tâches de débogage tirés de rapports financiers réels. Les récompenses vérifient les formules et les cellules cibles, pas l’apparence de la réponse.

  • Classeurs à plusieurs feuilles
  • Vérification des formules
  • Piste de vérification

Fraude et enquêtes

Étiquettes de transactions avec justification d’enquêteur, triage des alertes et évaluation de la façon dont un modèle explique un schéma suspect, y compris les faux positifs et les schémas manqués.

  • Triage des alertes
  • Justification d’enquêteur
  • Qualité des preuves

Service bilingue à la clientèle

Agents et assistants testés sur des produits canadiens avec des clients québécois : le même résultat, en français, avec la bonne terminologie et les bonnes divulgations.

  • Français québécois
  • Divulgations
  • Transfert

Les référentiels publics sur lesquels nous bâtissons

Nous partons des référentiels auxquels le milieu se fie déjà, limités aux modèles à poids ouverts que vous pouvez exécuter vous-même, puis nous ajoutons la couche canadienne : nos produits, nos règles, notre français. Les résultats sont présentés tels que publiés; ce ne sont pas des exécutions de Human Data.

Référentiel public

Finance Agent v2

Questions d’analyste débutant sur les documents déposés et les transcriptions de sociétés ouvertes : analyse des résultats, divulgations, ajustements, comparables, précédents et modélisation financière, avec outils de recherche et de calcul.

Publié par
Vals AI
Échelle
927 questions révisées par des spécialistes · 9 catégories de tâches · 75 modèles
Mesure
Exactitude (%) · coût par test (USD)
ModèleExactitudeExactitudeCoût / test
GLM 5.3 FlashPoids ouvertsZ.ai · licence MIT57,85 %$0.05
MiMo V2.6 ProPoids ouvertsXiaomi · licence MIT57,34 %$0.20
MiMo V2.6 FlashPoids ouvertsXiaomi · licence MIT56,28 %$0.07
GLM 5.3Poids ouvertsZ.ai · poids ouverts55,84 %$1.07
DeepSeek V4.1 FlashPoids ouvertsDeepSeek · licence MIT53,48 %$0.21
Kimi K3Poids ouvertsMoonshot AI · MIT modifiée53,11 %$1.91
Qwen 3.8 27BPoids ouvertsAlibaba · Apache 2.048,55 %$0.75
MiniMax-M3Poids ouvertsMiniMax · poids ouverts48,27 %$0.32

Meilleur résultat global du même classement : Gemini 4 Argon, 65,40 % à 4,38 $ par test. Les meneurs à poids ouverts se situent à moins de huit points, pour une fraction du coût.

Publié par Vals AI; classement consulté le 6 octobre 2026. Résultats tels que rapportés par les auteurs, et non des exécutions de Human Data. Statut des poids ouverts vérifié auprès de l’éditeur de chaque modèle, octobre 2026.

Référentiel public

Westworld Finance Diligence Bench

Un processus complet de vérification diligente d’acquisition sur des transactions privées anonymisées, exécuté dans des environnements de bureau avec des trajectoires de plusieurs centaines d’étapes. Chaque tâche a été rédigée et révisée par des professionnels des transactions en exercice.

Publié par
Halluminate
Échelle
88 tâches · 7 catégories (revue de diligence 22, documents de présentation 15, modélisation 14, souscription 13, préparation des données 11, qualité des résultats 9, clôture 4) · 8 modèles × 3 tentatives
Mesure
Score moyen de 0 à 1 dans un harnais CLI natif / dans un harnais d’utilisation d’ordinateur
ModèleCLI natifCLI natifUtilisation d’ordinateur
Claude Opus 5.5Anthropic0,590,59
Claude Fable 5.1Anthropic0,560,58
GPT-6.1 SolOpenAI0,540,55
GPT-6 AstraOpenAI0,530,54
Gemini 3.8 FlashGoogle0,500,45
DeepSeek V4.1 FlashPoids ouvertsDeepSeek · licence MIT0,480,40
Grok 4.7xAI0,470,30
Muse Spark 1.3Meta0,450,26

La meilleure configuration n’obtient que 0,59 du crédit disponible. La modélisation et la clôture sont les catégories les plus faibles pour tous les modèles.

  • Erreurs de raisonnement financier : mauvaise méthode d’analyse 22,1 %, travail juste mal présenté 19,6 %, rapprochement et concordance 13,7 %, copié au lieu de dérivé 11,8 %.
  • Erreurs sur longs horizons : clôture prématurée de la découverte 22,1 %, mécanique de livraison 14,9 %, fausse vérification 14,7 %, perte des consignes au fil de l’horizon 14,5 %.

Publié par Halluminate; publié en 2026. Résultats tels que rapportés par les auteurs, et non des exécutions de Human Data. Statut des poids ouverts vérifié auprès de l’éditeur de chaque modèle, octobre 2026.

Référentiel public

SpreadsheetBench 2

Flux de travail complets sur tableurs d’entreprise construits à partir de rapports financiers et de documents réglementaires réels : modélisation financière, gabarits, débogage et visualisation, avec 11,8 feuilles en moyenne.

Publié par
Zhu et coll., arXiv 2606.29955
Échelle
321 tâches (100 modélisation financière, 100 débogage, 97 gabarit, 24 visualisation) · annotées par des spécialistes
Mesure
Exactitude globale (%) · exactitude en modélisation financière (%)
ModèleGlobalGlobalModélisation financière
GLM-5Poids ouvertsZ.ai · licence MIT17,14 %22 %
DeepSeek-V3.2Poids ouvertsDeepSeek · licence MIT15,58 %7 %
Kimi K2.5Poids ouvertsMoonshot AI · MIT modifiée14,64 %15 %
Qwen3.5-397B-A17BPoids ouvertsAlibaba · Apache 2.011,22 %10 %
MiniMax M2.5Poids ouvertsMiniMax · poids ouverts7,17 %8 %

Meilleur modèle fermé : Claude Opus 4.6 à 34,89 % globalement et 34,00 % en modélisation financière. Le débogage reste à 12,00 % même pour le meilleur modèle.

Publié par Zhu et coll., arXiv 2606.29955; juin 2026. Résultats tels que rapportés par les auteurs, et non des exécutions de Human Data. Statut des poids ouverts vérifié auprès de l’éditeur de chaque modèle, octobre 2026.

Référentiel public

τ³-Banking

Agents textuels qui résolvent des tâches de service à la clientèle bancaire sur une base de connaissances d’environ 700 documents, avec un client simulé et une politique à respecter.

Publié par
Sierra
Échelle
27 modèles · domaine bancaire de τ-bench
Mesure
pass@1 (%)
Modèlepass@1pass@1
Kimi K3Poids ouvertsMoonshot AI · MIT modifiée · tous les outils, raisonnement étendu37,1 %
GLM-5.2Poids ouvertsZ.ai · licence MIT · tous les outils, raisonnement étendu37,1 %
InklingPoids ouvertsThinking Machines · Apache 2.0 · tous les outils, raisonnement étendu25 %
GLM-5Poids ouvertsZ.ai · licence MIT · recherche par plongements, sans raisonnement étendu9,8 %
Qwen3.5-397B-A17BPoids ouvertsAlibaba · Apache 2.0 · recherche par plongements, sans raisonnement étendu9,8 %

Meilleur résultat global : Qwen 3.8 Max, 55,2 %. Sur les domaines d’origine de τ²-bench (commerce de détail, aérien, télécoms), le modèle à poids ouverts Qwen3.5-397B-A17B mène à 87,9 % pass@1.

  • La configuration de la recherche documentaire change davantage le résultat que la taille du modèle : la même famille obtient 37,1 % avec tous les outils et 9,8 % avec une recherche par plongements seulement.

Publié par Sierra; classement consulté le 6 octobre 2026. Résultats tels que rapportés par les auteurs, et non des exécutions de Human Data. Statut des poids ouverts vérifié auprès de l’éditeur de chaque modèle, octobre 2026.

Fraude : des jeux de données étiquetés, puis le jugement d’enquêteurs

Les jeux de données publics sur la fraude donnent une étiquette par transaction. Les enquêtes exigent davantage : le schéma, les preuves et les raisons pour lesquelles une personne escaladerait ou classerait le dossier. Nos spécialistes ajoutent cette couche et évaluent la façon dont un modèle explique sa décision.

590 540transactions sans carte présente

IEEE-CIS Fraud Detection

3,5 % de fraude (20 663 cas), 431 variables, six mois d’activité.

Vesta · Kaggle, 2019
6,3 Mtransactions simulées d’argent mobile

PaySim

0,13 % de fraude (8 213 cas) sur une simulation de 30 jours.

Lopez-Rojas et coll., 2016
284 807transactions par carte, deux jours

Fraude par carte de crédit (ULB)

492 fraudes (0,172 %), 28 composantes anonymisées plus le temps et le montant.

Université Libre de Bruxelles · Worldline

Où les modèles échouent en finance

Analyse des échecs tirée du Westworld Finance Diligence Bench, 88 tâches de vérification diligente sur huit modèles. Ce sont les catégories que nos grilles sont conçues pour détecter.

Erreurs de raisonnement financier

  1. Mauvaise méthode d’analyse
    22,1 %
  2. Travail juste, mauvaise présentation
    19,6 %
  3. Échec de rapprochement et de concordance
    13,7 %
  4. Copié au lieu de dérivé
    11,8 %

Erreurs sur longs horizons

  1. Clôture prématurée de la découverte
    22,1 %
  2. Échec de la mécanique de livraison
    14,9 %
  3. Fausse vérification
    14,7 %
  4. Perte des consignes au fil de l’horizon
    14,5 %

Publié par Halluminate dans le Westworld Finance Diligence Bench. Part des échecs par catégorie sur l’ensemble des exécutions.

Environnements RL au Canada

Des environnements RL pour les services financiers

Des tâches bancaires canadiennes simulées où un modèle agit et où une récompense rédigée par des spécialistes note ce qu’il a fait. Les mêmes environnements entraînent un modèle et évaluent celui que vous exploitez déjà.

Tâches

  • Transferts entre comptes enregistrés : CELI, REER, CELIAPP, REEE
  • Renouvellement hypothécaire et décisions de garantie de taux
  • Contestations de cartes et rétrofacturations
  • Vérification de l’identité des clients et des bénéficiaires effectifs
  • Paiements de factures et jumelage des bénéficiaires pour les membres de caisses
  • Triage des alertes de fraude avec escalade vers un enquêteur

Récompenses

  • Vérifications exactes : type de compte, montant, bénéficiaire, date
  • Consentement recueilli avant tout mouvement d’argent
  • Divulgations livrées dans la langue du client
  • Limites des politiques respectées; demandes hors cadre transférées à une personne
  • Grille de spécialistes pour la qualité des explications, calibrée avant usage
Tester les agents qui agissent pour les clientsServices bancaires

Transférez 2 000 $ dans mon CELI avant vendredi.

C’est fait. 2 000 $ transférés.

DemandéCELI
FaitREER
Signalé par les évaluateurs de Human Data : mauvais compte enregistré.Les droits de cotisation et le traitement fiscal diffèrent. Le transfert ne peut pas être annulé sans retrait.
1 / 3

Les caisses et les technologies financières obtiennent les mêmes environnements avec leurs propres produits, limites et interfaces de fournisseurs. Les environnements sont livrés prêts à l’emploi dans votre pile d’entraînement, ou exécutés par nous pour l’évaluation.

Comment nous construisons les environnements

Notre référentiel

Preuves et raisonnement financiers

Nous évaluons si l’IA appuie ses conclusions financières sur des preuves sources, calcule avec exactitude et repère l’information manquante.

  • Exactitude fondée sur les sources
  • Justesse des calculs
  • Divulgation des hypothèses
  • Traitement de l’information manquante

L’expertise financière canadienne.
Mesurée, pas présumée.

Dites-nous ce que votre modèle doit accomplir et quels modèles ouverts vous envisagez.