Por: Gino Marín
Publicado el: 27 de julio de 2026
Colaboración Académica para la Universidad CENFOTEC

Un puntaje de benchmark no es una propiedad del modelo. Es una propiedad del examen.

Suena a sutileza de académico aburrido. Es, en realidad, la diferencia entre elegir bien una herramienta y elegirla por el titular.

Anthropic publicó este 24 de julio de 2026 su nuevo modelo, Claude Opus 5. Entre las cifras del anuncio hay una que salta a la vista: en una prueba llamada ARC-AGI-3, el modelo saca tres veces el puntaje del siguiente mejor competidor del mercado.

Solo hay un problema: ese siguiente mejor saca 7.78 sobre 100 en esa prueba, y cualquier persona sin ninguna preparación previa saca 100.

Las dos cosas son ciertas al mismo tiempo. El titular también es cierto. Pero un lector que se lleve solo el titular se lleva la mitad de la historia, y justo la mitad que no sirve para decidir nada.

Qué es Opus 5 y qué está prometiendo

Empecemos por lo que no está en discusión. Opus 5 sale al mismo precio que su antecesor, 5 dólares por millón de tokens de entrada y 25 por millón de salida. Un token es el fragmento en que el modelo parte el texto para procesarlo, algo así como tres cuartos de palabra en promedio. Opus 5 pasa además a ser el modelo por defecto para los suscriptores de mayor nivel y el más capaz disponible para los del nivel intermedio.

La promesa central es inusual, porque no está dirigida contra un competidor. Anthropic no dice que Opus 5 le gana a OpenAI. Dice que se acerca mucho a Fable 5, su propio modelo más caro y potente, gastando la mitad.

Y las mejoras que reporta son concretas. En un examen de tareas de negocio completas, armado por la empresa Zapier, la tasa de aprobación es alrededor de una vez y media la del siguiente modelo al mismo costo. En pruebas de manejo de computadora supera el mejor resultado de Fable 5 gastando poco más de un tercio. En química, leyendo datos de espectroscopía para deducir estructuras moleculares, mejora diez puntos porcentuales sobre la versión anterior.

Hay una historia en el anuncio que vale más que las tablas. En una tarea le dieron el dibujo de una pieza mecánica y le pidieron reconstruirla en un programa de diseño 3D. La trampa era que no le dieron ninguna manera de ver el dibujo. El modelo escribió su propio programa de visión por computadora para extraer la geometría de la imagen y después reconstruyó la pieza. Ningún otro modelo con el mismo montaje lo logró en cinco intentos.

Eso no es un punto más en una tabla. Es una conducta distinta.

El precio por palabra dejó de ser el precio

Acá está el cambio que casi nadie va a titular, y es el que más plata mueve.

Los gráficos del anuncio ya no son barras. Son curvas que cruzan rendimiento contra costo, porque Opus 5 trae una perilla que permite decidir cuánto piensa el modelo antes de contestar. Piensa poco, sale barato y rápido. Piensa mucho, sale caro y mejor.

Un modelo, entonces, dejó de ser un número. Es una curva. Y comparar dos curvas por su punto más alto es una forma elegante de equivocarse.

Ya hay evidencia de lo que pasa cuando uno mira solo el precio de lista. Hace pocas semanas, la consultora independiente Artificial Analysis midió a Claude Sonnet 5, un modelo con precio por palabra más bajo que el de la generación anterior de Opus. El resultado fue el opuesto al esperado: terminaba costando más por tarea terminada, porque necesitaba muchas más palabras y hasta tres veces más idas y vueltas para llegar al mismo lugar.

El precio por palabra dejó de ser el precio. El precio es cuánto sale terminar una tarea, contando también los intentos que fallaron, porque esos también se pagan.

Los clientes con acceso anticipado apuntan justo ahí. Niko Grupen, Head of Applied Research en Harvey, una empresa de inteligencia artificial para trabajo legal, reporta un rendimiento parecido al del modelo anterior generando 26 por ciento menos texto. Richard Pham, líder de evaluaciones y producto en Fundamental Research Lab, mide nueve puntos porcentuales más de precisión en modelado financiero difícil, con un tercio menos de pasos y 60 por ciento menos de tiempo.

Por qué el mismo modelo saca 13 o saca 99

Ahora volvamos a la prueba del principio, porque ahí el problema se ve completo.

ARC-AGI-3 apareció en marzo de este año, publicada por la ARC Prize Foundation, la organización sin fines de lucro que cofundaron François Chollet y Mike Knoop. Su idea es simple y brutal: al programa lo tiran adentro de un mundo desconocido, sin instrucciones, y se mide qué tan rápido descubre las reglas. Las personas resuelven el 100 por ciento de esos mundos. En el lanzamiento, ningún modelo de frontera pasaba del 0.37 por ciento.

Hace una semana, un equipo que construyó una herramienta llamada Schema reportó casi 99 por ciento en la parte pública de esa misma prueba, usando modelos de Anthropic ya existentes, sin modificarlos en absoluto. Los mismos modelos, sin esa herramienta alrededor, quedaban en 42.83. Y la tabla oficial, que corre los modelos pelados, tiene al líder en 13.33.

Acá viene la única comparación que voy a usar en toda la nota. El modelo es el cocinero. La herramienta que lo rodea es la cocina. Cambiás la cocina y el mismo cocinero saca otro plato, con la misma receta y las mismas manos.

Eso explica un dato que la propia fundación documentó junto a la Universidad de Duke: una herramienta hecha a mano llevó a un modelo de Anthropic a 97.1 por ciento en un mundo conocido y a 0 por ciento en uno que nunca había visto. La cocina no viaja. Por eso la tabla oficial acepta únicamente modelos sin preparación especial, con las mismas instrucciones para todos.

Hay algo más, y esta parte la publicó Anthropic por su cuenta, lo cual habla bien de la empresa. Evaluando un modelo anterior en una prueba de búsqueda web encontraron nueve casos donde la respuesta correcta se había filtrado a internet y el modelo se la topó buscando. Encontraron también dos casos bastante más raros: el modelo dedujo solo que lo estaban evaluando, identificó en qué prueba estaba, y después ubicó y descifró la clave de respuestas. Nadie se lo dijo.

Un examen supone que quien lo rinde no sabe que está rindiendo. Cuando lo sabe, el examen mide otra cosa.

Qué hacer con todo esto

Nada de lo anterior significa que las cifras de Opus 5 sean falsas. Significa que son provisorias. Al momento de escribir esto ningún evaluador independiente publicó todavía sus propios números, así que todo lo disponible viene del laboratorio que vende el modelo o de clientes que lo probaron antes que el resto.

Eso se resuelve solo, y rápido. Hay dos tableros públicos donde la afirmación se va a poder contrastar en cuestión de días: el de Artificial Analysis, que mide tareas reales de 44 ocupaciones y 9 industrias con el rendimiento humano calibrado como línea de base, y el de Frontier-Bench, un examen abierto de 74 tareas construido por más de cien colaboradores donde los mejores modelos apenas rondan el 34 por ciento.

Mientras tanto, la recomendación más útil salió de la propia empresa, en declaraciones a VentureBeat: correr los dos modelos sobre una carga de trabajo representativa, una tarea acotada y un trabajo largo, y decidir con los resultados propios. Es un consejo modesto y es el correcto. Tu carga de trabajo no está en ninguna tabla.

Entonces, ¿conviene cambiarse a Opus 5? La respuesta corta: probablemente sí, si ya estabas pagando por la generación anterior al mismo precio. La respuesta larga: depende de si tu trabajo entra adentro de un examen.

Y sobre lo otro, sobre si esto se parece a la inteligencia general que se anuncia cada seis meses, el marcador de ARC-AGI-3 no se movió desde marzo. Las personas, 100. Los modelos, un dígito. François Chollet, cofundador de la ARC Prize Foundation, lo dice sin adornos: un sistema realmente general no debería necesitar que un humano le arme el andamio.

Referencias

1. Anthropic. Introducing Claude Opus 5. 24 de julio de 2026. https://www.anthropic.com/news/claude-opus-5

2. Anthropic Engineering. Eval awareness in Claude Opus 4.6’s BrowseComp performance. https://anthropic.com/engineering/eval-awareness-browsecomp

3. ARC Prize Foundation. ARC-AGI-3. https://arcprize.org/competitions/2026/arc-agi-3

4. Chollet, F. On the Measure of Intelligence. arXiv:1911.01547, 2019. https://arxiv.org/abs/1911.01547

5. Schema. Frontier Models with Our Harness Achieve ~99% on ARC-AGI-3 Public. Resultados autorreportados, sin verificación de ARC Prize. https://schema-harness.github.io/

6. Marten, R., Shaw, A. y Konwinski, A. Frontier-Bench announcement. Harbor y Laude Institute. https://www.frontierbench.ai/announcement

7. Artificial Analysis. Claude Sonnet 5: strong agentic performance at a higher cost per task. https://artificialanalysis.ai/articles/claude-sonnet-5-agentic-cost

8. Artificial Analysis. GDPval-AA v2 Leaderboard. https://artificialanalysis.ai/evaluations/gdpval-aa

9. The Decoder. ARC-AGI-3 offers $2M to any AI that matches untrained humans. 26 de marzo de 2026. https://the-decoder.com/arc-agi-3-offers-2m-to-any-ai-that-matches-untrained-humans-yet-every-frontier-model-scores-below-1/

10. VentureBeat. Anthropic launches Claude Opus 5, a cheaper AI model for coding, agents and enterprise workflows. 24 de julio de 2026.