Se connecter

Benchmark

Qualité de traduction, langue par langue

Jeux de test WASH réservés, 17 langues. Notre moteur — Gemma ancré dans la mémoire de traduction WASH — face à la TA commerciale et aux LLM de pointe. Filtrez les langues, triez n'importe quelle colonne.

Ce sont des métriques automatisées. Les scores proviennent d'un modèle de qualité neuronal (XCOMET-XL) et de juges LLM à l'aveugle — pas d'évaluateurs humains. Ils estiment la qualité ; ils ne remplacent pas une évaluation professionnelle.

Validation humaine, en cours. Nous collaborons activement avec des professionnels du secteur de langue maternelle qui notent les sorties du moteur face à des validateurs humains dans notre plateforme d'évaluation. Ces évaluations d'experts — et pas seulement les métriques automatisées — serviront de base aux prochaines versions de ce benchmark.

XCOMET-XL

Avec référence — compare chaque traduction à une référence humaine. Le signal principal. Plus c'est haut, mieux c'est.

Langues
MoteurMYHA
Notre moteur85.191.893.882.593.182.290.688.393.173.477.573.481.0
Gemini 3 Flash84.690.893.482.092.282.790.588.091.373.077.174.279.7
DeepL83.892.493.582.592.881.490.489.392.569.275.369.876.8
Gemma 4 26B83.690.693.281.591.980.788.887.490.771.376.472.578.8
Claude Sonnet 4.683.690.892.780.292.481.689.487.391.271.976.471.877.5
Google Translate83.591.293.382.492.581.088.588.891.574.177.766.374.3
Lara82.991.693.480.592.081.489.786.790.268.377.369.674.6
ModernMT78.389.492.179.090.478.485.881.986.159.270.960.966.0
Tiny Aya + TMX78.689.866.871.867.375.7
Tiny Aya75.488.664.370.064.771.7
Meilleur de la colonnePlus bas de la colonneNotre moteurCliquez sur une colonne pour trier

Tiny Aya (un deuxième modèle de base) a été évalué sur un sous-ensemble de langues : ses lignes n'affichent que les langues testées et ne comptent pas de moyenne de corpus, elles restent donc hors classement. Voir le comparatif direct ci-dessous.

Le birman (my) et le haoussa (ha) sont affichés mais pas encore évalués — nous les benchmarkons activement et ajouterons leurs résultats bientôt. Ils ne comptent pas dans les moyennes.

Deuxième modèle de base — Tiny Aya

Un autre LLM de base pourrait-il dépasser Gemma ? Nous avons fait tourner Cohere Tiny Aya avec la même recherche dans la mémoire de traduction que notre moteur — un changement de base propre — et l'avons comparée directement. Gemma + TMX l'emporte toujours dans toutes les langues.

Moteuridswnehiurbnam
Notre moteur93.182.281.077.573.473.478.1
Gemma 4 26B90.780.778.876.472.571.371.4
Tiny Aya + TMX89.878.675.771.867.366.865.1
Tiny Aya88.675.471.770.064.764.360.3

Gemma + TMX bat Tiny Aya + TMX dans toutes les langues. L'apport de la mémoire est indépendant de la base, mais Gemma est la meilleure combinaison — elle reste donc notre moteur.

Tiny Aya + TMX dépasse tout de même Tiny Aya seule partout (+1,1 à +4,8 XCOMET) : la recherche aide quelle que soit la base qu'elle ancre. Si un futur modèle de base dépasse Gemma, c'est ici qu'on le verra en premier.

Cohere Tiny Aya (3.35B) · XCOMET-XL (basé sur référence), ×100, plus haut est meilleur · ajouté 2026-07-18.

Langues opaques à COMET — akan et créole haïtien

La métrique COMET ne peut pas les noter (son socle ne couvre ni le twi ni le créole) : tous les moteurs se regroupent près du plancher de la métrique, impossibles à départager. Elles sont évaluées à part par des grands modèles de langue qui classent à l'aveugle — un rang moyen plus bas est meilleur.

Akan / twi

L'akan est lui aussi hors distribution pour la métrique COMET ; il est donc évalué par les deux mêmes juges LLM à l'aveugle sur 255 segments. Les deux juges se sont déclarés compétents et ont raisonné sur de vraies spécificités du twi, et ils s'accordent fortement (Spearman ρ = 0,83).

MoteurClaude Opus 4.8Gemini 3.1 Pro
Rang moyen% victoiresRang moyen% victoires
Gemini 3 Flash1.7953%1.4468%
Google Translate2.1633%2.1726%
Lara3.365%3.354%
ModernMT4.604%4.751%
Claude Sonnet 4.64.802%4.882%
Notre moteur4.942%4.940%
Gemma 4 26B6.240%6.370%

Gemini domine nettement l'akan et notre moteur se situe au milieu du peloton — mais il dépasse clairement son propre modèle de base (environ 1,3 rang de mieux), donc la mémoire de traduction relève encore un base faible ici. Comme pour le créole haïtien, combler l'écart revient au modèle de base ; nous le montrons plutôt que de le cacher.

Créole haïtien

Le créole haïtien est hors distribution pour le socle de la métrique COMET ; il est donc évalué séparément par deux grands modèles de langue jugeant à l'aveugle. Chacun classe la sortie de chaque moteur par segment ; un rang moyen plus bas est meilleur, et le % de victoires est la part de segments où il arrive premier.

MoteurClaude Opus 4.8Gemini 3.1 Pro
Rang moyen% victoiresRang moyen% victoires
Gemini 3 Flash3.3927.5%3.1634%
Google Translate3.8216.3%3.5817.6%
Lara3.9015%3.8316.3%
DeepL4.1812.4%4.376.5%
Gemma 4 26B5.475.9%5.904.6%
Claude Sonnet 4.65.487.2%5.603.9%
Notre moteur5.617.8%5.477.8%
ModernMT5.993.9%5.925.9%
Kreyòl-MT(spécialisé)7.163.9%7.183.3%

Les deux juges s'accordent : Gemini domine le classement, et notre moteur se situe au milieu du peloton sur le créole haïtien. La recherche sur la mémoire créole, encore mince, n'apporte ici que peu de gain — le Gemma de base et Gemma + TMX se tiennent à quelques dixièmes de rang l'un de l'autre — cet écart tient donc au modèle de base, pas à ce que la mémoire peut encore combler. Nous le montrons plutôt que de le cacher.

Comment c'est mesuré

Jeu de données
baobabtech/tmx-benchmark-results
Échantillon
153–300 segments par langue
Généré
2026-06-27