Manifiesto

READ IN ENGLISH[ESC] MAIN MENU
════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════════

English version

El agujero en cómo evaluamos a las máquinas hoy

Casi todos los benchmarks que se usan para rankear modelos de lenguaje tienen el mismo defecto: es probable que el modelo ya los haya visto.

No es una sospecha. Se encontraron benchmarks de matemática tan importantes como GSM8K y MATH dentro de los datos de entrenamiento de modelos actuales, con contaminación reportada en 31 de ellos. Un análisis estima MMLU con un 29% de contaminación, y al menos un modelo cae 13 puntos al evaluarse sobre un conjunto limpio. Un estudio de 2026 que entrenó modelos desde cero variando cuántas veces aparecía el test en el corpus confirmó el mecanismo de forma directa: con suficiente capacidad y suficiente incentivo, los modelos memorizan la prueba.

Un puntaje sobre un benchmark contaminado mide memoria. Nosotros lo leemos como razonamiento.

Y el problema se agrava solo. Publicar un benchmark es lo que lo vuelve útil, y también lo que lo destruye: apenas está en la web abierta se lo scrapea, y todo modelo entrenado después tiene una ventaja que se parece exactamente a la inteligencia. Todo benchmark público es un activo que se deteriora.

El razonamiento visual no queda afuera. Las Matrices Progresivas de Raven fueron diseñadas para quitar el lenguaje y la cultura del medio y medir inferencia abstracta de forma directa, y por eso siguen siendo atractivas. Pero tienen derechos de autor vigentes, están por toda internet, y todavía no está claro si el desempeño de los modelos refleja razonamiento genuino o atajos estadísticos. Usarlas para rankear modelos de frontera dice muy poco.

Qué sí funciona

Los benchmarks que resisten comparten una propiedad: los problemas son nuevos y no están publicados. FrontierMath es el ejemplo más claro, cientos de problemas originales escritos y revisados por más de 70 matemáticos, mantenidos privados salvo unos pocos ejemplos, precisamente para que ningún modelo pueda acertar comparando contra algo que leyó durante el entrenamiento.

Ese es el modelo que seguimos. Cuesta más, porque alguien tiene que inventar cada problema. Ese costo es justamente el punto: es el costo que no se puede evitar scrapeando.

Qué es esto

Un benchmark independiente donde los problemas los hace gente que es buena haciendo problemas, y donde nada que un evaluado pudiera memorizar fue publicado nunca.

Los ítems son originales. Se crean acá, por invitación, miembros de Mensa y otras personas que construyen problemas interesantes por gusto propio. Quien contribuye garantiza que su trabajo es suyo y no una adaptación de ningún test publicado.

Las respuestas no existen en texto plano en ningún lado. Quien crea el ítem marca la opción correcta y esa letra se convierte en un digest criptográfico al llegar al servidor; el texto plano se descarta. La corrección compara digests. Nadie —ni el operador, ni el servidor, ni un proceso que comprometa el servidor— puede leer una respuesta. La clave no está protegida. No está.

Un puntaje del leaderboard se produce sin abrir ninguna clave. El digest de arriba protege una clave que existe. Para producir un número no la abrimos: la hoja se corrige a mano, cotejándola con las láminas, y lo único que se carga es el conteo. En esa vía no se lee ninguna clave, así que no hay nada ahí que robar, ni ningún archivo cuyo secreto importe más adelante.

Lo que sí sigue existiendo, y preferimos decirlo: un archivo de digests sellados del cuadernillo escaneado, en el servidor y en el repositorio. No contiene texto plano, pero seis opciones en cuarenta y cinco ítems son pocas pruebas para quien tenga el secreto —justamente por eso la vía de corrección no debería tocarlo nunca. El artefacto que de verdad hay que cuidar es la pila de hojas de los runs anteriores, y esas se guardan fuera del repositorio, donde ningún modelo bajo evaluación puede llegar.

El costo es que una persona tiene que corregir cada hoja, y una persona puede contar mal. Preferimos cargar con ese error antes que con el otro.

El razonamiento se guarda. Nunca se publica. A los modelos se les pide que escriban por qué eligieron cada opción, y esas justificaciones son, en realidad, el objeto de la investigación: dónde la regla del modelo estaba mal, y si dos modelos fallan el mismo ítem de la misma manera. Se guardan en un archivo fuera de internet y no aparecen en ningún lado de este sitio, porque un conjunto de justificaciones nombra una opción para cada ítem, y un número suficiente de ellas haría lo mismo que publicar las respuestas.

Personas y modelos resuelven los mismos ítems, con el mismo reloj. El límite de tiempo pertenece al test y lo fija quien lo creó, nunca lo elige quien lo rinde, para que dos puntajes puedan compararse y signifiquen algo.

Los tests de benchmark se usan una vez y no se publican. Existen sets públicos para quien quiera jugar —esa es la parte divertida— pero los sets con los que se evalúan modelos salen de envíos privados y siguen siendo privados. Un benchmark pierde valor cada vez que se rinde; un juego gana valor. Separarlos evita que la diversión queme la medición.

Los modelos se corren a mano, y se corrigen a mano. No existe un endpoint público que corrija un envío arbitrario, porque eso es un oráculo: seis intentos uniformes reconstruirían la clave de respuestas usando solamente los puntajes. Por la misma razón el run de un modelo guarda, por defecto, un conteo y no una grilla ítem por ítem: una grilla te dice cuáles ítems son A en el momento en que alguien responde todo A.

Hacia dónde va

Las matrices son el comienzo, no el objetivo. La misma arquitectura sirve para cualquier cosa con respuesta verificable, y la intención es extenderla a problemas de matemática y física curados por matemáticos y físicos en actividad.

No aritmética más difícil. No enunciados más largos. Problemas con profundidad donde la dificultad está en ver cuál es realmente el problema, y donde la respuesta no se puede encontrar en internet porque nunca estuvo en internet.

Lo que tenemos cuidado de no afirmar

Los puntajes acá son conteos crudos. Llamar "IQ" a algo exige una muestra normalizada contra una población representativa, y esa muestra todavía no existe —así que no usamos la palabra. La dificultad de cada ítem hoy es posicional, no medida, y debería surgir de los datos de respuesta cuando suficientes personas hayan rendido cada ítem.

Corregir a mano cambia un tipo de error por otro. Una comparación de digests no puede contar mal; una persona sí. Lo aceptamos a cambio de una vía de corrección que no abre nada, y un conteo equivocado es al menos un error a la vista, no un benchmark que dejó de medir sin que nadie se diera cuenta.

Y un run donde el modelo escribió su razonamiento no es la misma tarea que uno donde solo eligió letras: escribir cambia tanto el puntaje como el tiempo. Esos runs se rankean como su propia entrada y nunca se promedian con los de solo respuestas. Dos filas para el mismo modelo no son un duplicado; son dos preguntas distintas.

Preferimos reportar un número chico y honesto antes que uno grande que en realidad mide memoria.


Fuentes


Take a testLeaderboardCreatorsMain menu