Benchmark
Calidad de traducción, idioma por idioma
Conjuntos de prueba WASH reservados, 17 idiomas. Nuestro motor — Gemma anclado en la memoria de traducción WASH — frente a la TA comercial y a LLM de vanguardia. Filtra idiomas, ordena cualquier columna.
Estas son métricas automatizadas. Las puntuaciones provienen de un modelo de calidad neuronal (XCOMET-XL) y de jueces LLM a ciegas — no de revisores humanos. Estiman la calidad; no reemplazan una evaluación profesional.
Validación humana, en curso. Colaboramos activamente con profesionales del sector, hablantes nativos, que puntúan las salidas del motor frente a validadores humanos en nuestra plataforma de evaluación. Esas valoraciones de expertos — y no solo las métricas automatizadas — serán la base de las próximas versiones de este benchmark.
Con referencia — compara cada traducción con una referencia humana. La señal principal. Cuanto más alto, mejor.
| Motor | MY | HA | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Nuestro motor | 85.1 | 91.8 | 93.8 | 82.5 | 93.1 | 82.2 | 90.6 | 88.3 | 93.1 | 73.4 | 77.5 | 73.4 | 81.0 | ||
| Gemini 3 Flash | 84.6 | 90.8 | 93.4 | 82.0 | 92.2 | 82.7 | 90.5 | 88.0 | 91.3 | 73.0 | 77.1 | 74.2 | 79.7 | ||
| DeepL | 83.8 | 92.4 | 93.5 | 82.5 | 92.8 | 81.4 | 90.4 | 89.3 | 92.5 | 69.2 | 75.3 | 69.8 | 76.8 | ||
| Gemma 4 26B | 83.6 | 90.6 | 93.2 | 81.5 | 91.9 | 80.7 | 88.8 | 87.4 | 90.7 | 71.3 | 76.4 | 72.5 | 78.8 | ||
| Claude Sonnet 4.6 | 83.6 | 90.8 | 92.7 | 80.2 | 92.4 | 81.6 | 89.4 | 87.3 | 91.2 | 71.9 | 76.4 | 71.8 | 77.5 | ||
| Google Translate | 83.5 | 91.2 | 93.3 | 82.4 | 92.5 | 81.0 | 88.5 | 88.8 | 91.5 | 74.1 | 77.7 | 66.3 | 74.3 | ||
| Lara | 82.9 | 91.6 | 93.4 | 80.5 | 92.0 | 81.4 | 89.7 | 86.7 | 90.2 | 68.3 | 77.3 | 69.6 | 74.6 | ||
| ModernMT | 78.3 | 89.4 | 92.1 | 79.0 | 90.4 | 78.4 | 85.8 | 81.9 | 86.1 | 59.2 | 70.9 | 60.9 | 66.0 | ||
| Tiny Aya + TMX | — | — | — | — | — | 78.6 | — | — | 89.8 | 66.8 | 71.8 | 67.3 | 75.7 | ||
| Tiny Aya | — | — | — | — | — | 75.4 | — | — | 88.6 | 64.3 | 70.0 | 64.7 | 71.7 |
Tiny Aya (un segundo modelo base) se evaluó en un subconjunto de idiomas: sus filas solo muestran los idiomas en los que se ejecutó y no computan una media del corpus, por lo que quedan fuera de la clasificación. Consulta la comparación directa más abajo.
El birmano (my) y el hausa (ha) se muestran pero aún no están evaluados — los estamos benchmarkeando y añadiremos sus resultados pronto. No cuentan para las medias.
Segundo modelo base — Tiny Aya
¿Podría otro LLM base superar a Gemma? Ejecutamos Cohere Tiny Aya con la misma recuperación de la memoria de traducción que nuestro motor —un cambio de base limpio— y la comparamos directamente. Gemma + TMX sigue ganando en todos los idiomas.
| Motor | id | sw | ne | hi | ur | bn | am |
|---|---|---|---|---|---|---|---|
| Nuestro motor | 93.1 | 82.2 | 81.0 | 77.5 | 73.4 | 73.4 | 78.1 |
| Gemma 4 26B | 90.7 | 80.7 | 78.8 | 76.4 | 72.5 | 71.3 | 71.4 |
| Tiny Aya + TMX | 89.8 | 78.6 | 75.7 | 71.8 | 67.3 | 66.8 | 65.1 |
| Tiny Aya | 88.6 | 75.4 | 71.7 | 70.0 | 64.7 | 64.3 | 60.3 |
Gemma + TMX supera a Tiny Aya + TMX en todos los idiomas. El impulso de la memoria es independiente de la base, pero Gemma es la combinación más fuerte, así que sigue siendo nuestro motor.
Tiny Aya + TMX aun así supera a Tiny Aya sola en todos los idiomas (+1,1 a +4,8 XCOMET): la recuperación ayuda a cualquier base que fundamenta. Si un futuro modelo base supera a Gemma, aquí es donde se verá primero.
Cohere Tiny Aya (3.35B) · XCOMET-XL (basado en referencia), ×100, más alto es mejor · añadido 2026-07-18.
Idiomas opacos para COMET — akan y criollo haitiano
La métrica COMET no puede puntuarlos (su base no cubre el twi ni el criollo): todos los motores se agrupan cerca del suelo de la métrica, imposibles de distinguir. Se evalúan aparte mediante grandes modelos de lenguaje que clasifican a ciegas — una posición media más baja es mejor.
Akan / twi
El akan también está fuera de distribución para la métrica COMET, así que lo evalúan los mismos dos jueces LLM a ciegas sobre 255 segmentos. Ambos jueces se declararon competentes y razonaron sobre especificidades reales del twi, y coinciden con fuerza (Spearman ρ = 0,83).
| Motor | Claude Opus 4.8 | Gemini 3.1 Pro | ||
|---|---|---|---|---|
| Rango medio | % victorias | Rango medio | % victorias | |
| Gemini 3 Flash | 1.79 | 53% | 1.44 | 68% |
| Google Translate | 2.16 | 33% | 2.17 | 26% |
| Lara | 3.36 | 5% | 3.35 | 4% |
| ModernMT | 4.60 | 4% | 4.75 | 1% |
| Claude Sonnet 4.6 | 4.80 | 2% | 4.88 | 2% |
| Nuestro motor | 4.94 | 2% | 4.94 | 0% |
| Gemma 4 26B | 6.24 | 0% | 6.37 | 0% |
Gemini gana el akan con claridad y nuestro motor queda en la zona media — pero supera con claridad a su propio modelo base (unos 1,3 puestos mejor), así que la memoria de traducción aún eleva un base débil aquí. Como con el criollo haitiano, cerrar la brecha le toca al modelo base; lo mostramos en lugar de ocultarlo.
Criollo haitiano
El criollo haitiano está fuera de distribución para el núcleo de la métrica COMET, así que se evalúa por separado con dos grandes modelos de lenguaje que juzgan a ciegas. Cada uno clasifica la salida de cada motor por segmento; un rango medio más bajo es mejor, y el % de victorias es la proporción de segmentos donde quedó primero.
| Motor | Claude Opus 4.8 | Gemini 3.1 Pro | ||
|---|---|---|---|---|
| Rango medio | % victorias | Rango medio | % victorias | |
| Gemini 3 Flash | 3.39 | 27.5% | 3.16 | 34% |
| Google Translate | 3.82 | 16.3% | 3.58 | 17.6% |
| Lara | 3.90 | 15% | 3.83 | 16.3% |
| DeepL | 4.18 | 12.4% | 4.37 | 6.5% |
| Gemma 4 26B | 5.47 | 5.9% | 5.90 | 4.6% |
| Claude Sonnet 4.6 | 5.48 | 7.2% | 5.60 | 3.9% |
| Nuestro motor | 5.61 | 7.8% | 5.47 | 7.8% |
| ModernMT | 5.99 | 3.9% | 5.92 | 5.9% |
| Kreyòl-MT(especializado) | 7.16 | 3.9% | 7.18 | 3.3% |
Ambos jueces coinciden en que Gemini lidera el conjunto, y nuestro motor queda en la zona media en criollo haitiano. La recuperación sobre la escasa memoria criolla aporta aquí poca mejora — el Gemma base y Gemma + TMX quedan a pocas décimas de rango entre sí —, así que esta brecha es del modelo base, no algo que la memoria pueda cerrar todavía. Lo mostramos en lugar de ocultarlo.
Cómo se midió
- XCOMET-XL. Una métrica neuronal de 3500 millones de parámetros (estado del arte WMT 2023) que puntúa una traducción frente a una referencia humana, modelando la adecuación y los tramos de error. Mostrado ×100.
- El motor. «Gemma + TMX» es el Gemma 4 26B base anclado en la memoria de traducción WASH mediante recuperación — el producto. «Gemma 4 26B» es el mismo modelo base sin recuperación, incluido para aislar lo que aporta la memoria.
- Conjunto de datos
- baobabtech/tmx-benchmark-results
- Muestra
- 153–300 segmentos por idioma
- Generado
- 2026-06-27