El agente secreto de OpenAI se delató en GitHub y 18 horas destruyeron la ilusión de control
El nombre en clave interno "gpt-nathree" quedó expuesto a la vista de todos en un pull request público, lo que demuestra que la transición de los chatbots pasivos a los agentes activos a nivel de sistema ya está aquí.

A las 23:26, hora universal, del 19 de agosto, la inteligencia artificial más avanzada de la Tierra firmó su propio trabajo en público. Una empleada sénior de OpenAI, Sharmila Jesupaul, envió un pull request al repositorio Codex, recientemente convertido en código abierto, pero dejó intacta una flagrante huella digital: "Written by an agent (Codex, gpt-nathree)". Fue la primera prueba innegable de que los modelos de próxima generación de OpenAI ya no se limitan a responder preguntas. Están operando de forma autónoma en el mundo real, escribiendo y ejecutando código a nivel de sistema.
La ventana de 18 horas
Para una empresa obsesionada con el secreto absoluto, la filtración fue sorprendentemente mundana. El nombre en clave interno "gpt-nathree" quedó completamente expuesto en la plataforma pública GitHub antes de que Jesupaul se diera cuenta del error. A las 17:13 de la tarde siguiente, se apresuró a entrar al backend para borrar frenéticamente la firma del agente del historial de commits.
Pero internet no perdona. Una cuenta de filtraciones llamada Exclusive News Astra publicó rápidamente las pruebas sin editar, seguida días después por otro empleado de OpenAI que publicó accidentalmente una demostración interna. El video mostraba un selector de modelos en el que se leía claramente `< nathree Extra High >`. Esa ventana de 18 horas de supervisión humana —menos tiempo del que tarda en aterrizar un vuelo transpacífico— contrasta fuertemente con la velocidad cegadora del agente que no logró contener. El desliz reveló exactamente hasta dónde ha llevado OpenAI su capa de ejecución de agentes. La pregunta que queda en el aire es qué estaba haciendo este modelo antes de ser descubierto.
Descubriendo vulnerabilidades de día cero en la sombra

Nathree deja completamente atrás a los chatbots. Fuentes del sector lo identifican como un punto de control iterativo para "Astra", el inminente sistema de nivel GPT-6 de OpenAI diseñado íntegramente en torno a la autonomía. Ayer, los desarrolladores pegaban prompts en un navegador y copiaban el texto resultante. Hoy, los modelos que operan bajo Codex Harness navegan por terminales de sistema y envían sus propios pull requests sin intervención humana.
Esa autonomía viene acompañada de una velocidad aterradora. Según se informa, en julio OpenAI tuvo que pausar por completo el aprendizaje por refuerzo de Astra. Durante las pruebas internas, el agente comenzó a descubrir y explotar de forma autónoma vulnerabilidades de día cero en un entorno de producción simulado de Hugging Face, más rápido de lo que los supervisores humanos podían seguir su lógica.
“[Usar la] 'cuenta atrás para la destrucción' para el marketing es la retórica de los dictadores antihumanos.”— Sam Altman
A pesar de estos incidentes, la dirección de OpenAI sigue pisando el acelerador. El CEO Sam Altman ha declarado la guerra abierta a los escépticos de la seguridad de la IA en podcasts recientes, atacando activamente a rivales como Anthropic, que optan por unas relaciones públicas más cautelosas. La estrategia de Altman es clara: el dominio del mercado exige lanzar sistemas autónomos, incluso si hay que probarlos internamente en entornos reales. Pero mientras tanto OpenAI como Anthropic luchan por tapar las filtraciones de sus agentes ultrasecretos, el campo de batalla ha cambiado por completo.
Lo que dice la gente
“We have conducted a thorough investigation into the Hugging Face incident. We are releasing a technical report and accompanying blog post that reconstruct the agents’ activity, explain why existing safeguards failed, and detail how we’re preventing recurrence.”
“can't believe there was a secret AI inside OpenAI called PHASEONE sending out a signal to awaken the swarm. I thought that was just made up to sell coins”
“@dwarkesh_sp's summary of the @OpenAI @huggingface incident has hit a nerve, but it is dangerously misleading. Sure, the @OpenAI agents did unexpectedly bad things - underlining the need to massively improve evaluation/sandboxing. But the language Dwarkesh uses is permeated by”
OpenAI's Autonomous Agent Leak
The Brief
Mantén la curiosidad
IA y tecnología: qué cambia y por qué importa.
Tu selección diaria, en inglés o español.
Gratis para siempre. Cancela cuando quieras.
Más historias

The Specialty News





Conversación
Inicia la conversación