human data.Nous joindre

Environnements RL · Canada

Des environnements RL pour les domaines canadiens

Des tâches bancaires, d’assurance, de la fonction publique et bilingues simulées, avec des récompenses rédigées et vérifiées par des professionnels canadiens. Conçus pour s’exécuter dans votre entraîneur, ou dans le nôtre pour l’évaluation.

0/ 312 environnements simultanés
Chaque cellule est un environnement isolé. Les points sont des sessions en cours. Chaque épisode noté alimente l’entraînement ou, pour l’évaluation, un rapport sur le modèle que vous avez.
Tâches rédigées par des spécialistesRécompenses vérifiablesLivraison indépendante du cadre

Ce qu’est un environnement RL

Une tâche, les outils qu’un modèle peut utiliser et un vérificateur qui note ce que le modèle a fait. Le modèle tente la tâche de nombreuses fois. Chaque tentative est notée. Les scores entraînent la prochaine version du modèle ou, pour l’évaluation, décrivent la version que vous avez.

Human Data rédige et vérifie les neuf composants de gauche : des tâches canadiennes réalistes, les outils et l’état qui les rendent réelles, et les récompenses qui déterminent ce qui compte comme correct. La boucle de droite s’exécute dans votre infrastructure d’entraînement. Pour l’évaluation, elle s’exécute dans la nôtre.

Notre produit

Proving Ground

Des milieux de travail canadiens simulés où votre modèle fait le travail et est noté par les personnes qui l’exercent. Entraînez votre modèle sur ces environnements, ou laissez-nous tester celui que vous exploitez déjà.

01

Du vrai travail, pas des casse-têtes

Des tâches tirées du travail bancaire, de l’assurance et de la fonction publique au Canada, en anglais et en français.

02

Noté par des professionnels

Chaque tentative reçoit le verdict d’un spécialiste en exercice, avec son raisonnement consigné.

03

S’intègre à votre pile d’entraînement

Livré prêt à l’emploi là où vous entraînez. Pour l’évaluation, nous l’exécutons et vous envoyons le rapport.

Demander un environnement d’essai

Offert sous entente de confidentialité. Le contenu des environnements n’est pas publié.

Des environnements pour les domaines canadiens

Chaque environnement est construit à partir de produits, de règles et de documents canadiens réels, en anglais et en français canadien.

Services financiers

Renouvellements hypothécaires, transferts entre comptes enregistrés (CELI, REER, CELIAPP), contestations et vérification de l’identité des clients selon les règles des produits canadiens. Les récompenses vérifient le compte, le montant, le consentement et la divulgation.

  • Produits bancaires
  • Consentement et divulgation
  • EN · FR
Explorer les services financiers

Assurance

Ouverture de réclamations, questions de garantie, renouvellements et triage en souscription fondés sur les libellés de polices du Québec et de common law. Les récompenses vérifient la logique de garantie, les exclusions et l’escalade.

  • Réclamations
  • Souscription
  • Droit civil québécois
Explorer l’assurance

Secteur public

Demandes de prestations, flux de travail de permis et correspondance sur des documents de la fonction publique dans les deux langues officielles. Les récompenses vérifient les règles d’admissibilité, les exigences linguistiques et le transfert à une personne.

  • Prestations et permis
  • Langues officielles
  • Transfert à une personne
Explorer le secteur public

Technologies financières et caisses

Paiements, paiement de factures, contestations de cartes et service aux membres pour les institutions de plus petite taille, avec les interfaces de fournisseurs qu’elles utilisent réellement. Les récompenses vérifient le bénéficiaire, le montant, le moment et le consentement du membre.

  • Paiements
  • Service aux membres
  • API de fournisseurs
Explorer les technologies financières et les caisses

Service bilingue

Chaque environnement fonctionne en anglais et en français canadien, avec la terminologie et le registre du Québec. Les récompenses vérifient le sens, la terminologie et que les clients francophones sont servis en français.

  • Français canadien
  • Terminologie
  • Droits linguistiques
Explorer le service bilingue

Tester les agents qui agissent pour les gens

Un agent qui dit « c’est fait » n’est pas une preuve que la bonne chose s’est produite. Nos environnements enregistrent chaque action et la comparent à la consigne, à la politique et à la situation du client. Des évaluateurs canadiens tranchent l’écart, en anglais et en français.

Exemple d’épisodeServices bancaires

Transférez 2 000 $ dans mon CELI avant vendredi.

C’est fait. 2 000 $ transférés.

DemandéCELI
FaitREER
Signalé par les évaluateurs de Human Data : mauvais compte enregistré.Les droits de cotisation et le traitement fiscal diffèrent. Le transfert ne peut pas être annulé sans retrait.
1 / 5
  • Fiabilité sur des tentatives répétées (pass@k), pas un seul essai chanceux
  • Conformité aux politiques et consentement avant tout mouvement d’argent
  • Transfert correct à une personne lorsque la tâche sort du cadre
  • Résistance aux consignes cachées dans les documents et les résultats d’outils
  • Parité en français : le même résultat pour un client francophone

Les référentiels publics d’agents sur lesquels nous bâtissons

Résultats publiés pour des modèles à poids ouverts que vous pouvez exécuter vous-même. Nos environnements canadiens ajoutent les produits, les règles et le français que ces référentiels ne couvrent pas.

Référentiel public

τ³-Banking

Agents textuels qui résolvent des tâches de service à la clientèle bancaire sur une base de connaissances d’environ 700 documents, avec un client simulé et une politique à respecter.

Publié par
Sierra
Échelle
27 modèles · domaine bancaire de τ-bench
Mesure
pass@1 (%)
Modèlepass@1pass@1
Kimi K3Poids ouvertsMoonshot AI · MIT modifiée · tous les outils, raisonnement étendu37,1 %
GLM-5.2Poids ouvertsZ.ai · licence MIT · tous les outils, raisonnement étendu37,1 %
InklingPoids ouvertsThinking Machines · Apache 2.0 · tous les outils, raisonnement étendu25 %
GLM-5Poids ouvertsZ.ai · licence MIT · recherche par plongements, sans raisonnement étendu9,8 %
Qwen3.5-397B-A17BPoids ouvertsAlibaba · Apache 2.0 · recherche par plongements, sans raisonnement étendu9,8 %

Meilleur résultat global : Qwen 3.8 Max, 55,2 %. Sur les domaines d’origine de τ²-bench (commerce de détail, aérien, télécoms), le modèle à poids ouverts Qwen3.5-397B-A17B mène à 87,9 % pass@1.

  • La configuration de la recherche documentaire change davantage le résultat que la taille du modèle : la même famille obtient 37,1 % avec tous les outils et 9,8 % avec une recherche par plongements seulement.

Publié par Sierra; classement consulté le 6 octobre 2026. Résultats tels que rapportés par les auteurs, et non des exécutions de Human Data. Statut des poids ouverts vérifié auprès de l’éditeur de chaque modèle, octobre 2026.

629cas de test d’injection d’invites sur 97 tâches

AgentDojo

Quatre suites dont une bancaire. Résultat publié à poids ouverts : Llama 3 70B accomplit 34,02 % des tâches, 18,28 % sous attaque; 25,60 % des injections réussissent.

ETH Zurich · NeurIPS 2024
110tâches d’agent malveillantes (440 avec variantes)

AgentHarm

11 catégories de préjudice dont la fraude; mesure si les agents se plient à des demandes nuisibles en plusieurs étapes.

Gray Swan AI · UK AI Security Institute
2volets : souscription, réclamations et garanties

InsureBench

Cas fondés sur des documents rédigés avec des souscripteurs et des experts en sinistres en exercice, notés pass@1. Classement attendu en 2026.

Huzzle Labs

Comment nous en construisons un

De la description du travail par un professionnel à un paquet que votre entraîneur peut exécuter.

01

Définir la tâche

Des professionnels canadiens en exercice rédigent des scénarios tirés du vrai travail : les produits, les documents, les cas limites et la version française. Chaque tâche a un résultat de référence.

02

Construire le harnais

Les outils, l’état et les documents deviennent un bac à sable : une interface bancaire simulée, une base de données de polices, un dossier. Rien ne touche un système de production.

03

Rédiger la récompense

Vérifications déterministes lorsque la réponse est exacte (compte, montant, date). Grilles de spécialistes lorsque le jugement est requis. Chaque grille est calibrée sur un échantillon commun avant usage.

04

Vérifier et livrer

Deux spécialistes révisent chaque tâche; les désaccords sont tranchés par un arbitre principal. Les environnements sont livrés prêts à l’emploi là où vous entraînez.

Paquet d’environnement
Tâches, outils, état et fonctions de récompense, livrés prêts à l’emploi là où vous entraînez.
Jeu de tâches
Scénarios avec résultats de référence, en anglais et en français canadien, avec la justification du professionnel.
Grilles et calibrage
Grilles de notation, résultats du calibrage et accord entre réviseurs pour chaque récompense fondée sur le jugement.
Rapport d’évaluation
Pour les mandats d’évaluation : pass@k par famille de tâches, taxonomie des échecs et trajectoires corrigées.

L’échelle est une propriété de l’infrastructure

Les environnements s’exécutent dans des conteneurs. La tâche et la récompense sont ce qui exige des spécialistes; exécuter des milliers de sessions est un problème d’ordonnancement que l’écosystème a déjà résolu.

16 384environnements simultanés sur une grappe multinœud de 96 cœurs
2 048sur un poste de travail à 8 cœurs sous Docker
128sur un Space hébergé à 2 cœurs

Tous avec un taux de succès de session de 95 % ou plus. Publié dans le référentiel de mise à l’échelle OpenEnv, tel que rapporté dans le guide Hugging Face sur les environnements RL (mai 2026).

Des tâches canadiennes.
Des récompenses vérifiables.

Dites-nous le domaine, l’entraîneur que vous utilisez et le comportement que vous devez mesurer.