Du vrai travail, pas des casse-têtes
Des tâches tirées du travail bancaire, de l’assurance et de la fonction publique au Canada, en anglais et en français.
Environnements RL · Canada
Des tâches bancaires, d’assurance, de la fonction publique et bilingues simulées, avec des récompenses rédigées et vérifiées par des professionnels canadiens. Conçus pour s’exécuter dans votre entraîneur, ou dans le nôtre pour l’évaluation.
Une tâche, les outils qu’un modèle peut utiliser et un vérificateur qui note ce que le modèle a fait. Le modèle tente la tâche de nombreuses fois. Chaque tentative est notée. Les scores entraînent la prochaine version du modèle ou, pour l’évaluation, décrivent la version que vous avez.
Human Data rédige et vérifie les neuf composants de gauche : des tâches canadiennes réalistes, les outils et l’état qui les rendent réelles, et les récompenses qui déterminent ce qui compte comme correct. La boucle de droite s’exécute dans votre infrastructure d’entraînement. Pour l’évaluation, elle s’exécute dans la nôtre.
Notre produit
Des milieux de travail canadiens simulés où votre modèle fait le travail et est noté par les personnes qui l’exercent. Entraînez votre modèle sur ces environnements, ou laissez-nous tester celui que vous exploitez déjà.
Des tâches tirées du travail bancaire, de l’assurance et de la fonction publique au Canada, en anglais et en français.
Chaque tentative reçoit le verdict d’un spécialiste en exercice, avec son raisonnement consigné.
Livré prêt à l’emploi là où vous entraînez. Pour l’évaluation, nous l’exécutons et vous envoyons le rapport.
Offert sous entente de confidentialité. Le contenu des environnements n’est pas publié.
Chaque environnement est construit à partir de produits, de règles et de documents canadiens réels, en anglais et en français canadien.
Renouvellements hypothécaires, transferts entre comptes enregistrés (CELI, REER, CELIAPP), contestations et vérification de l’identité des clients selon les règles des produits canadiens. Les récompenses vérifient le compte, le montant, le consentement et la divulgation.
Ouverture de réclamations, questions de garantie, renouvellements et triage en souscription fondés sur les libellés de polices du Québec et de common law. Les récompenses vérifient la logique de garantie, les exclusions et l’escalade.
Demandes de prestations, flux de travail de permis et correspondance sur des documents de la fonction publique dans les deux langues officielles. Les récompenses vérifient les règles d’admissibilité, les exigences linguistiques et le transfert à une personne.
Paiements, paiement de factures, contestations de cartes et service aux membres pour les institutions de plus petite taille, avec les interfaces de fournisseurs qu’elles utilisent réellement. Les récompenses vérifient le bénéficiaire, le montant, le moment et le consentement du membre.
Chaque environnement fonctionne en anglais et en français canadien, avec la terminologie et le registre du Québec. Les récompenses vérifient le sens, la terminologie et que les clients francophones sont servis en français.
Un agent qui dit « c’est fait » n’est pas une preuve que la bonne chose s’est produite. Nos environnements enregistrent chaque action et la comparent à la consigne, à la politique et à la situation du client. Des évaluateurs canadiens tranchent l’écart, en anglais et en français.
Transférez 2 000 $ dans mon CELI avant vendredi.
C’est fait. 2 000 $ transférés.
Résultats publiés pour des modèles à poids ouverts que vous pouvez exécuter vous-même. Nos environnements canadiens ajoutent les produits, les règles et le français que ces référentiels ne couvrent pas.
Agents textuels qui résolvent des tâches de service à la clientèle bancaire sur une base de connaissances d’environ 700 documents, avec un client simulé et une politique à respecter.
| Modèle | pass@1 | pass@1 |
|---|---|---|
| Kimi K3Poids ouvertsMoonshot AI · MIT modifiée · tous les outils, raisonnement étendu | 37,1 % | |
| GLM-5.2Poids ouvertsZ.ai · licence MIT · tous les outils, raisonnement étendu | 37,1 % | |
| InklingPoids ouvertsThinking Machines · Apache 2.0 · tous les outils, raisonnement étendu | 25 % | |
| GLM-5Poids ouvertsZ.ai · licence MIT · recherche par plongements, sans raisonnement étendu | 9,8 % | |
| Qwen3.5-397B-A17BPoids ouvertsAlibaba · Apache 2.0 · recherche par plongements, sans raisonnement étendu | 9,8 % |
Quatre suites dont une bancaire. Résultat publié à poids ouverts : Llama 3 70B accomplit 34,02 % des tâches, 18,28 % sous attaque; 25,60 % des injections réussissent.
ETH Zurich · NeurIPS 202411 catégories de préjudice dont la fraude; mesure si les agents se plient à des demandes nuisibles en plusieurs étapes.
Gray Swan AI · UK AI Security InstituteCas fondés sur des documents rédigés avec des souscripteurs et des experts en sinistres en exercice, notés pass@1. Classement attendu en 2026.
Huzzle LabsDe la description du travail par un professionnel à un paquet que votre entraîneur peut exécuter.
Des professionnels canadiens en exercice rédigent des scénarios tirés du vrai travail : les produits, les documents, les cas limites et la version française. Chaque tâche a un résultat de référence.
Les outils, l’état et les documents deviennent un bac à sable : une interface bancaire simulée, une base de données de polices, un dossier. Rien ne touche un système de production.
Vérifications déterministes lorsque la réponse est exacte (compte, montant, date). Grilles de spécialistes lorsque le jugement est requis. Chaque grille est calibrée sur un échantillon commun avant usage.
Deux spécialistes révisent chaque tâche; les désaccords sont tranchés par un arbitre principal. Les environnements sont livrés prêts à l’emploi là où vous entraînez.
Les environnements s’exécutent dans des conteneurs. La tâche et la récompense sont ce qui exige des spécialistes; exécuter des milliers de sessions est un problème d’ordonnancement que l’écosystème a déjà résolu.
Tous avec un taux de succès de session de 95 % ou plus. Publié dans le référentiel de mise à l’échelle OpenEnv, tel que rapporté dans le guide Hugging Face sur les environnements RL (mai 2026).
Dites-nous le domaine, l’entraîneur que vous utilisez et le comportement que vous devez mesurer.