Iniciar sesión

Benchmark

Calidad de traducción, idioma por idioma

Conjuntos de prueba WASH reservados, 17 idiomas. Nuestro motor — Gemma anclado en la memoria de traducción WASH — frente a la TA comercial y a LLM de vanguardia. Filtra idiomas, ordena cualquier columna.

Estas son métricas automatizadas. Las puntuaciones provienen de un modelo de calidad neuronal (XCOMET-XL) y de jueces LLM a ciegas — no de revisores humanos. Estiman la calidad; no reemplazan una evaluación profesional.

Validación humana, en curso. Colaboramos activamente con profesionales del sector, hablantes nativos, que puntúan las salidas del motor frente a validadores humanos en nuestra plataforma de evaluación. Esas valoraciones de expertos — y no solo las métricas automatizadas — serán la base de las próximas versiones de este benchmark.

XCOMET-XL

Con referencia — compara cada traducción con una referencia humana. La señal principal. Cuanto más alto, mejor.

Idiomas
MotorMYHA
Nuestro motor85.191.893.882.593.182.290.688.393.173.477.573.481.0
Gemini 3 Flash84.690.893.482.092.282.790.588.091.373.077.174.279.7
DeepL83.892.493.582.592.881.490.489.392.569.275.369.876.8
Gemma 4 26B83.690.693.281.591.980.788.887.490.771.376.472.578.8
Claude Sonnet 4.683.690.892.780.292.481.689.487.391.271.976.471.877.5
Google Translate83.591.293.382.492.581.088.588.891.574.177.766.374.3
Lara82.991.693.480.592.081.489.786.790.268.377.369.674.6
ModernMT78.389.492.179.090.478.485.881.986.159.270.960.966.0
Tiny Aya + TMX78.689.866.871.867.375.7
Tiny Aya75.488.664.370.064.771.7
Mejor de la columnaMás bajo de la columnaNuestro motorHaz clic en una columna para ordenar

Tiny Aya (un segundo modelo base) se evaluó en un subconjunto de idiomas: sus filas solo muestran los idiomas en los que se ejecutó y no computan una media del corpus, por lo que quedan fuera de la clasificación. Consulta la comparación directa más abajo.

El birmano (my) y el hausa (ha) se muestran pero aún no están evaluados — los estamos benchmarkeando y añadiremos sus resultados pronto. No cuentan para las medias.

Segundo modelo base — Tiny Aya

¿Podría otro LLM base superar a Gemma? Ejecutamos Cohere Tiny Aya con la misma recuperación de la memoria de traducción que nuestro motor —un cambio de base limpio— y la comparamos directamente. Gemma + TMX sigue ganando en todos los idiomas.

Motoridswnehiurbnam
Nuestro motor93.182.281.077.573.473.478.1
Gemma 4 26B90.780.778.876.472.571.371.4
Tiny Aya + TMX89.878.675.771.867.366.865.1
Tiny Aya88.675.471.770.064.764.360.3

Gemma + TMX supera a Tiny Aya + TMX en todos los idiomas. El impulso de la memoria es independiente de la base, pero Gemma es la combinación más fuerte, así que sigue siendo nuestro motor.

Tiny Aya + TMX aun así supera a Tiny Aya sola en todos los idiomas (+1,1 a +4,8 XCOMET): la recuperación ayuda a cualquier base que fundamenta. Si un futuro modelo base supera a Gemma, aquí es donde se verá primero.

Cohere Tiny Aya (3.35B) · XCOMET-XL (basado en referencia), ×100, más alto es mejor · añadido 2026-07-18.

Idiomas opacos para COMET — akan y criollo haitiano

La métrica COMET no puede puntuarlos (su base no cubre el twi ni el criollo): todos los motores se agrupan cerca del suelo de la métrica, imposibles de distinguir. Se evalúan aparte mediante grandes modelos de lenguaje que clasifican a ciegas — una posición media más baja es mejor.

Akan / twi

El akan también está fuera de distribución para la métrica COMET, así que lo evalúan los mismos dos jueces LLM a ciegas sobre 255 segmentos. Ambos jueces se declararon competentes y razonaron sobre especificidades reales del twi, y coinciden con fuerza (Spearman ρ = 0,83).

MotorClaude Opus 4.8Gemini 3.1 Pro
Rango medio% victoriasRango medio% victorias
Gemini 3 Flash1.7953%1.4468%
Google Translate2.1633%2.1726%
Lara3.365%3.354%
ModernMT4.604%4.751%
Claude Sonnet 4.64.802%4.882%
Nuestro motor4.942%4.940%
Gemma 4 26B6.240%6.370%

Gemini gana el akan con claridad y nuestro motor queda en la zona media — pero supera con claridad a su propio modelo base (unos 1,3 puestos mejor), así que la memoria de traducción aún eleva un base débil aquí. Como con el criollo haitiano, cerrar la brecha le toca al modelo base; lo mostramos en lugar de ocultarlo.

Criollo haitiano

El criollo haitiano está fuera de distribución para el núcleo de la métrica COMET, así que se evalúa por separado con dos grandes modelos de lenguaje que juzgan a ciegas. Cada uno clasifica la salida de cada motor por segmento; un rango medio más bajo es mejor, y el % de victorias es la proporción de segmentos donde quedó primero.

MotorClaude Opus 4.8Gemini 3.1 Pro
Rango medio% victoriasRango medio% victorias
Gemini 3 Flash3.3927.5%3.1634%
Google Translate3.8216.3%3.5817.6%
Lara3.9015%3.8316.3%
DeepL4.1812.4%4.376.5%
Gemma 4 26B5.475.9%5.904.6%
Claude Sonnet 4.65.487.2%5.603.9%
Nuestro motor5.617.8%5.477.8%
ModernMT5.993.9%5.925.9%
Kreyòl-MT(especializado)7.163.9%7.183.3%

Ambos jueces coinciden en que Gemini lidera el conjunto, y nuestro motor queda en la zona media en criollo haitiano. La recuperación sobre la escasa memoria criolla aporta aquí poca mejora — el Gemma base y Gemma + TMX quedan a pocas décimas de rango entre sí —, así que esta brecha es del modelo base, no algo que la memoria pueda cerrar todavía. Lo mostramos en lugar de ocultarlo.

Cómo se midió

Conjunto de datos
baobabtech/tmx-benchmark-results
Muestra
153–300 segmentos por idioma
Generado
2026-06-27