Ce que nous évaluons
Nous évaluons si l’IA préserve le sens professionnel entre l’anglais et le français canadiens, y compris les preuves, les réserves et l’incertitude présentes dans le document source.
Portée des tâches
Tâches appariées en anglais et en français canadien dans la communication professionnelle, avec contexte explicite et documents sources. Les tâches utilisent du contenu public, sous licence ou créé pour l’occasion.
Méthodes d’évaluation
Ce que nous mesurons
- Préservation du sens
- Terminologie et registre
- Cohérence des preuves
- Incertitude appropriée
Révision par des spécialistes
Réviseurs, traducteurs et professionnels bilingues possédant l’expertise du domaine concerné. Les réviseurs conçoivent les tâches, affinent les critères de notation, évaluent les réponses et tranchent les désaccords.
Conception de l’évaluation
Nous documentons la sélection des tâches, les autorisations sur les données, les règles de notation et les paramètres des modèles avant l’évaluation. Une annotation pilote vérifie que les réviseurs appliquent les critères de façon cohérente. Les désaccords importants font l’objet d’une révision d’expert supplémentaire.
Rapports d’évaluation
Les rapports documentent les versions de modèles, les dates d’évaluation, les tailles d’échantillon, la performance et les limites. Nous fournissons les critères de notation et les documents à l’appui dans le respect des autorisations sur les données du projet.
Portée du référentiel
Les constats s’appliquent aux tâches professionnelles et aux variétés de langue incluses dans l’évaluation. La couverture est documentée afin que les équipes puissent repérer où des essais linguistiques supplémentaires sont nécessaires.
Les référentiels publics sur lesquels nous bâtissons
Résultats publiés pour des modèles à poids ouverts qui couvrent une partie de ce terrain. Notre référentiel ajoute la couche canadienne.
- COLE · compréhension du français québécois (GRAAL, Université Laval, arXiv 2510.05046) : 23 tâches · 95 modèles. Meilleur résultat à poids ouverts affiché : DeepSeek-V3 (deepseek-chat), 65,2 %.
- AEPC-QA · certification en assurance du Québec (Beauchemin & Khoury, Université Laval, arXiv 2603.07825) : 807 questions · 51 modèles · livre fermé et avec recherche documentaire. Meilleur résultat à poids ouverts affiché : DeepSeek-R1 (deepseek-reasoner), 36,3 %.
Des référentiels sur mesure pour vos systèmes d’IA
Testez la performance des modèles sur les tâches et les normes de votre secteur.
Discuter du développement de référentielsVoir nos référentiels