¿Buscas atención médica? Soy el Dr. César Méndez, cirujanoSoy paciente →
Las herramientas

Módulo 01 · 11 min

Benchmarks: cuáles importan y cuáles son marketing

Este tema cambia rápido (modelos, precios, herramientas). La idea y el criterio no caducan, pero verifica los nombres y precios actuales. Última revisión: julio de 2026.

Cada vez que sale un modelo, su anuncio viene lleno de gráficas: 'estado del arte en 12 benchmarks', '95% en tal prueba'. Es fácil marearse y elegir por el número más grande. Esta lección te enseña a leer esos números con ojo crítico — porque muchos son reales, pero varios son puro marketing.

Qué es un benchmark (y por qué existen)

Un benchmark es un examen estandarizado para modelos: un set de tareas con respuestas conocidas donde mides qué porcentaje resuelve cada modelo. Sirven para comparar de forma más o menos justa. El problema es que, cuando un examen se vuelve famoso, empieza a corromperse.

¿Qué benchmark importa para TU tarea?

Interactivo

Qué medir

SWE-bench / código real

resolver issues reales de repos, no acertijos de juguete

Consejo: Ignora el puntaje 'general': mira quién resuelve bugs reales. Suele ganar el especialista en código, no el más famoso.

Regla que no caduca: define tu tarea primero, elige el modelo por cómo rinde EN ESA tarea, no por su fama.

El puntaje 'general' de un modelo es marketing. Lo que decide es cómo rinde en TU tarea concreta. Elige lo que vas a hacer y fíjate qué deberías mirar de verdad — y por qué el 'mejor en promedio' no siempre gana en lo tuyo.

El que más te importa para construir: SWE-bench

SWE-bench le da al modelo issues REALES de proyectos de GitHub y mide si logra escribir el parche que los arregla. Eso se parece mucho más a construir de verdad que un examen de opción múltiple. Tiene dos sabores clave: SWE-bench Verified (tareas en Python, más conocido) y SWE-bench Pro (más difícil, muchos lenguajes y repos, resistente a trampas).

⚠️ El problema de la contaminación

Cuando un benchmark es muy popular, sus respuestas terminan en los datos con los que entrenan los modelos nuevos. Entonces el modelo no lo RESUELVE: lo RECUERDA. En 2026 SWE-bench Verified se contaminó tanto que hasta OpenAI dejó de reportarlo, y por encima de ~80% los puntajes ahí ya dicen poco. Un número altísimo puede significar 'memorizó el examen', no 'es mejor construyendo'.

La otra trampa: los números que se auto-reportan

Muchas tablas de líderes listan puntajes que envió el propio fabricante del modelo, no un tercero independiente. En una tabla famosa de 2026, de 100 modelos listados solo UNO estaba verificado de forma independiente; los otros 99 los reportó cada empresa. No es que mientan siempre, pero un puntaje que el vendedor se puso a sí mismo hay que tomarlo con pinzas.

Benchmarks que suelen ser más marketing

  • Exámenes de conocimiento general saturados (tipo MMLU): casi todos los modelos top ya rozan el techo, así que un 0.5% de diferencia no cambia nada para ti.
  • 'Estado del arte en CASI todos los benchmarks': fíjate en cuáles omiten; se eligen las gráficas que favorecen.
  • Cualquier número redondo y espectacular sin decir quién lo midió ni en qué condiciones.

Ejemplo trabajado: dos modelos, cuál creerle

El modelo A presume '95% en SWE-bench Verified'. El modelo B reporta '60% en SWE-bench Pro'. El novato elige A por el número más grande. Pero Verified está contaminado y saturado arriba de 80%, mientras que Pro es más difícil y da diferenciación real entre 23% y 69%. Un 60% en Pro dice MÁS que un 95% en Verified. Leer el número sin leer el examen te engaña.

💡 La única prueba que no miente: la tuya

El mejor benchmark es tu propio proyecto. Toma una tarea real de lo que estás construyendo, dásela a dos o tres modelos, y compara los resultados con tus ojos. Cinco minutos de esto te dicen más sobre cuál te conviene que cualquier gráfica de un anuncio.

Lo que te llevas

  • SWE-bench (sobre todo Pro) es el benchmark que más se parece a construir de verdad.
  • Cuidado con la contaminación: un número altísimo puede ser memoria, no capacidad.
  • Desconfía de puntajes auto-reportados sin verificación independiente.
  • Los exámenes saturados y el 'estado del arte en casi todo' son señales de marketing.
  • La prueba definitiva es correr tu propia tarea en los modelos candidatos.
No elijas modelo por el número del anuncio. Elígelo por cómo resuelve TU tarea. Ese es el único benchmark que te paga las cuentas.

Comentarios

Inicia sesión (arriba) para leer y participar en la conversación de la comunidad.