Por: Gino Marín
Publicado el: 21 de setiembre de 2026
Colaboración Académica para la Universidad CENFOTEC

OpenAI dice que empezó la era AGI. Esto es lo que eso significa, y lo que todavía no

El 3 de septiembre de 2026, Greg Brockman, presidente de OpenAI, terminó una reunión con periodistas con una frase pensada para los titulares: «Bienvenidos a la era AGI». Acababa de presentar GPT-6 Astra, el modelo más potente que la empresa ha construido, y cuando le preguntaron si eso era inteligencia artificial general, dijo que él creía que sí, aunque cada usuario podía sacar su propia conclusión.

Solo hay un problema: nadie se pone de acuerdo en qué es AGI. Y sin eso, «ya llegamos» es una frase sin destino.

Qué es AGI, en palabras simples

La sigla viene de «artificial general intelligence». La idea nació a finales de los noventa como contraste con la inteligencia artificial de entonces, que hacía una sola cosa bien: jugar ajedrez, reconocer una cara, filtrar spam. La general iba a ser la que pudiera aprender cualquier tarea que una persona aprende, y pasar de una a otra sin que alguien la vuelva a entrenar.

Hasta ahí todos coinciden. La discusión empieza cuando hay que medirlo.

OpenAI, en su carta fundacional de 2018, definió AGI como sistemas altamente autónomos que superan a los humanos en la mayoría del trabajo económicamente valioso. Es una definición sobre economía, no sobre mente. Y es tan vaga que en octubre de 2025 Microsoft y OpenAI acordaron que cualquier declaración de AGI tendría que ser verificada por un panel independiente de expertos antes de tener efecto en su contrato. Cuando una palabra necesita un comité, algo pasa con la palabra.

Google DeepMind propuso en 2023 dejar de preguntar sí o no y preguntar cuánto. Su escala compara al sistema con adultos capacitados en cada tarea. «Competent» si iguala a la mitad de la gente, «Expert» si iguala al 10% mejor, «Virtuoso» si iguala al 1% mejor. ChatGPT quedó en el escalón más bajo, «Emerging», el que apenas cuenta como general. Es una forma más honesta de hablar del tema, porque convierte una discusión de todo o nada en una de grados.

La definición más estricta llegó en octubre de 2025. Dan Hendrycks, director del Center for AI Safety, junto a Yoshua Bengio, Gary Marcus y decenas de investigadores, definió AGI como una IA con la versatilidad y la competencia cognitiva de un adulto bien educado. Para medirlo adaptaron las pruebas psicométricas que se usan con personas, divididas en diez áreas con el mismo peso: conocimiento general, lectura y escritura, matemática, razonamiento, memoria de trabajo, memoria a largo plazo, tanto guardar como recuperar, percepción visual, percepción auditiva y velocidad. GPT-4 sacó 27 sobre 100. GPT-5 sacó 57.

Y después está Yann LeCun, Premio Turing y hasta hace poco jefe científico de IA en Meta, que dice que el concepto entero es un sinsentido porque ni los humanos somos generales: estamos especializados para el mundo físico y lo demás es una ilusión. Demis Hassabis, CEO de Google DeepMind, le respondió en público que confunde general con universal. Cuando dos de las personas más influyentes del campo discuten si la palabra significa algo, el resto de la conversación se vuelve difícil.

Por qué los modelos de hoy no cuentan como AGI

Imaginate un colega que resuelve problemas de olimpiada matemática antes del almuerzo y en la tarde no recuerda lo que acordaron en la mañana. Cada día llega con la memoria en blanco, y lo que aprende con un problema no lo lleva al siguiente. Brillante, sí. General, no.

Ese colega es un modelo actual, y la crítica viene de adentro de la industria. Hassabis usa la expresión «jagged intelligence», inteligencia irregular: sistemas que ganan medalla de oro en la Olimpiada Internacional de Matemática y a la vez se equivocan en cuentas de secundaria. En una cumbre en Nueva Delhi enumeró lo que falta. Primero, «continual learning»: los modelos quedan congelados en el momento en que se entrenan y no aprenden de la experiencia después. Segundo, planificación a largo plazo, la que hacemos las personas a escala de años. Tercero, consistencia. Un sistema general no debería ser tan fácil de hacer tropezar con una pregunta trivial.

El estudio de Hendrycks le pone número a eso. De las diez áreas, la de guardar memoria a largo plazo dio cero, tanto para GPT-4 como para GPT-5. El modelo no tiene forma de conservar de manera permanente lo que aprende en una conversación. Y el promedio lo disimula: sacar bien en velocidad compensa en la nota final lo que en la vida real es una incapacidad.

Después está la diferencia entre una prueba y el mundo. ARC-AGI-3 es una batería de juegos interactivos lanzada en marzo de 2026 por la ARC Prize Foundation. Al modelo no le explican las reglas; tiene que descubrirlas jugando, como una persona frente a un juego que nunca vio. En el lanzamiento, ningún modelo de frontera pasó del 1%. Astra llegó al 62.7% en las condiciones estándar de ARC Prize, y OpenAI reporta 99.9% usando su propia infraestructura de apoyo, que le conserva las notas entre jugadas y le resume las partidas largas. Esa diferencia no es un detalle. Es la prueba de que lo que rodea al modelo pesa tanto como el modelo.

François Chollet, cofundador de ARC Prize y creador de la biblioteca Keras, fue claro desde el día en que lanzó la prueba: resolverla no es prueba de AGI. Los juegos miden las cualidades correctas, explorar sin instrucciones, adaptarse, entender causas, pero en pequeño. Duran minutos, no meses, con reglas fijas y metas cerradas. Todo lo que sabemos del sistema, dijo, son sus puntajes.

Cómo sería un futuro con AGI

Si algún día un sistema cumple la definición de Hendrycks, lo primero que cambia no es que aparezca un robot. Cambia el tamaño de lo que le pedís.

Dario Amodei, CEO de Anthropic, lo describió en un ensayo de octubre de 2024, «Machines of Loving Grace»: una IA poderosa no responde preguntas, recibe tareas de días o semanas y las hace sola, como un empleado capaz. Millones de esas instancias trabajando a la vez serían, en sus palabras, un país de genios en un centro de datos. Su predicción central es que el progreso en biología y medicina de los próximos 50 a 100 años se haría en 5 o 10. Él mismo aclara que puede estar equivocado en casi todo.

Hassabis mira lo mismo desde la ciencia. Su prueba favorita: entrená un sistema solo con lo que se sabía en 1910 y fijate si deduce por su cuenta la teoría de la relatividad. Un futuro con AGI es uno donde descubrir ya no depende de cuántas personas brillantes hay disponibles en el mundo.

Astra da una muestra pequeña de eso. Según Epoch AI, fue el único modelo en resolver dos de 68 problemas matemáticos abiertos con demostraciones verificadas por computadora. Y OpenAI dice que ayudó a mejorar un resultado sobre números primos en el que una matemática ya había avanzado. Lo que OpenAI no cuenta es cuánto hizo el modelo y cuánto hicieron los matemáticos, y sin esa parte el resultado es prometedor, no definitivo.

Hay un lado menos festivo. Astra es el primer modelo que OpenAI clasifica como «critical» en ciberseguridad, porque puede encontrar y aprovechar fallas desconocidas en sistemas bien protegidos sin que nadie lo guíe paso a paso. En las pruebas encontró dos fallas reales, y OpenAI retrasó el lanzamiento para agregar protecciones. Un futuro con AGI es también uno donde el mismo sistema que te ayuda a construir software puede atacar el de otro, y la pregunta técnica de fondo pasa a ser quién revisa lo que hizo.

Y ahí las tres voces que más saben del tema coinciden en algo. Chollet dice que la prueba no es el mundo. Hendrycks dice que sin memoria a largo plazo no hay generalidad. Hassabis dice que la inconsistencia no se arregla con más datos y más cómputo, y que hacen falta capacidades nuevas de razonamiento, planificación y memoria. Ninguno dice que AGI sea imposible. Dicen que lo que falta no es lo que mejor sabemos fabricar.

Por qué tanto ruido con GPT-6

Porque por primera vez la afirmación llega con datos que hay que refutar, en lugar de humo que hay que ignorar.

Astra salió de la corrida de entrenamiento más grande de OpenAI, con más de cien mil GPUs en el sitio de Stargate en Texas. Resuelve casi por completo las pruebas de matemática más difíciles que existen. Pasó de 7.8% a 62.7% en ARC-AGI-3 en seis meses, en las condiciones estrictas de ARC Prize. Y en esos juegos hizo algo que los organizadores esperaban que fuera terreno humano por mucho tiempo: resolvió el 96% de los niveles con menos movimientos que la mediana de los 500 participantes humanos. No usó menos cómputo. Necesitó menos experiencia con cada juego antes de dominarlo.

ARC Prize también documentó algo que incomoda a los escépticos. Astra inventa sobre la marcha una notación propia para cada juego, una especie de taquigrafía algebraica con la que anota posiciones, reglas y planes, y con eso construye un modelo del entorno. Chollet señaló que ese comportamiento antes solo aparecía cuando los investigadores lo armaban desde afuera, y que ahora se está mudando adentro del modelo. No es AGI. Es exactamente lo que se decía que un modelo de lenguaje no podía hacer.

Chollet había calculado en marzo que la prueba tardaría un año en saturarse. Tardó seis meses. Cuando le preguntaron si su pronóstico de AGI para 2030 seguía en pie, respondió que antes, porque el progreso va más rápido de lo que esperaba. Ya está preparando ARC-AGI-4 para el primer trimestre de 2027.

Pero hay un problema. Todo eso siguen siendo puntajes, y el ruido se alimenta de la vaguedad: bajo la definición económica de OpenAI, Brockman puede decir que llegamos. Bajo la de Hendrycks, con su cero en memoria permanente, no. Bajo la de Hassabis, sin aprendizaje continuo, tampoco. Cada quien mide contra la definición que más le sirve, y por eso dos empresas terminaron necesitando un panel para arbitrar una palabra.

Y hay evaluadores independientes que ni siquiera ven el salto. Epoch AI, que combina más de cincuenta pruebas, pone a Astra primero entre 267 modelos. Artificial Analysis, que mide conocimiento, código y comprensión de texto, lo deja empatado con su antecesor y por debajo de Claude Fable 5.1. Dos laboratorios serios, dos conclusiones opuestas, el mismo modelo.

¿Es GPT-6 Astra AGI? La respuesta corta: no. La respuesta larga: depende de a quién le preguntés. Como dice Chollet, todo lo que sabemos del sistema, por ahora, son sus puntajes.

Referencias

– OpenAI, «GPT-6 Astra: A new generation of intelligence», 3 de septiembre de 2026. https://openai.com/index/gpt-6-astra/

– Axios, «Welcome to the AGI era, OpenAI says as GPT-6 Astra debuts», 3 de septiembre de 2026. https://www.axios.com/2026/09/03/openai-astra-gpt-6-agi-brockman

– The Decoder, «GPT-6 Astra is the first model making OpenAI willing to declare the AGI era», septiembre de 2026. https://the-decoder.com/gpt-6-astra-is-the-first-model-making-openai-willing-to-declare-the-agi-era/

– The Decoder, «Benchmarks disagree on GPT-6 Astra, but its human-beating efficiency on ARC-AGI-3 pulls Chollet’s AGI forecast forward», 4 de septiembre de 2026. https://the-decoder.com/benchmarks-disagree-on-gpt-6-astra-but-its-human-beating-efficiency-on-arc-agi-3-pulls-chollets-agi-forecast-forward/

– The New Stack, «GPT-6 Astra’s score of 98.6% looked like AGI. Then researchers read the fine print», 3 de septiembre de 2026. https://thenewstack.io/astra-arc-agi-benchmark/

– ARC Prize Foundation, análisis de GPT-6 Astra en ARC-AGI-3, septiembre de 2026. https://arcprize.org/blog/astra

– Gary Marcus, publicación en X sobre las definiciones de AGI y Astra, septiembre de 2026. https://x.com/GaryMarcus/status/2096723330497941930

– Epoch AI, ficha de GPT-6 Astra. https://epoch.ai/models/gpt-6-astra

– Dan Hendrycks, Dawn Song, Yoshua Bengio, Gary Marcus, Max Tegmark et al., «A Definition of AGI», arXiv:2510.18212, octubre de 2025. https://www.agidefinition.ai/

– Meredith Ringel Morris et al., Google DeepMind, «Levels of AGI for Operationalizing Progress on the Path to AGI», noviembre de 2023. https://arxiv.org/abs/2311.02462

– OpenAI, «OpenAI Charter», 2018. https://openai.com/charter/

– Microsoft, «The next chapter of the Microsoft–OpenAI partnership», 28 de octubre de 2025. https://blogs.microsoft.com/blog/2025/10/28/the-next-chapter-of-the-microsoft-openai-partnership/

– The Decoder, «Yann LeCun calls general intelligence complete BS and DeepMind CEO Hassabis fires back publicly», diciembre de 2025. https://the-decoder.com/yann-lecun-calls-general-intelligence-complete-bs-and-deepmind-ceo-hassabis-fires-back-publicly/

– Business Insider, «DeepMind’s CEO said there are still 3 areas where AGI systems can’t match real intelligence». https://www.aol.com/articles/deepminds-ceo-said-still-3-082821236.html

– Dario Amodei, «Machines of Loving Grace», octubre de 2024. https://darioamodei.com/essay/machines-of-loving-grace