The Specialty News
IA

GPT-6 Astra alcanza el 99.9% en pruebas de AGI y se convierte en la primera amenaza cibernética crítica de OpenAI

El modelo pasó de una línea de base del 7.8% a la casi perfección en tareas de razonamiento, pero su impecable capacidad para militarizar vulnerabilidades de software obliga a un repentino reinicio de la seguridad

Por The Specialty News DeskEditado por 4 min read
GPT-6 Astra alcanza el 99.9% en pruebas de AGI y se convierte en la primera amenaza cibernética crítica de OpenAI
Foto: openai.com

La creación más reciente de OpenAI es la primera inteligencia artificial clasificada oficialmente por su propio creador como una amenaza de ciberseguridad "Crítica". En una prueba diseñada para ver si el software puede convertir de forma autónoma vulnerabilidades conocidas en armas funcionales, GPT-6 Astra obtuvo un 100 por ciento perfecto. Se trata de una escalada repentina y extrema en la capacidad de las máquinas que transforma la tecnología de un chatbot útil a un operador informático autónomo, capaz de realizar ingeniería inversa de binarios y construir modelos 3D sin intervención humana.

La ilusión del 99.9 por ciento

La onda de choque comenzó con una filtración de una prueba de rendimiento. Horas antes del lanzamiento oficial, un usuario de X llamado Chubby♨️ publicó un fragmento de datos que mostraba un salto del 7.8 al 98.6 por ciento en ARC-AGI-3, una prueba diseñada para medir la brecha exacta restante hacia la inteligencia artificial general. El número oficial final fue aún mayor: 99.9 por ciento. Para ponerlo en perspectiva, esto es como ver a un estudiante que reprobó un examen de matemáticas de tercer grado el mes pasado defender de repente una tesis doctoral en astrofísica.

El presidente de OpenAI, Greg Brockman, avivó el fuego al sugerir públicamente que los historiadores recordarán este lanzamiento específico como el amanecer de la AGI. Sin embargo, los evaluadores rigurosos encontraron rápidamente el asterisco. Esa puntuación casi perfecta requiere un entorno de pruebas altamente especializado y costoso que preserva estados de razonamiento opacos entre solicitudes. Cuando se evalúa mediante llamadas estándar a la API sin estado, la puntuación de Astra cae al 62.7 por ciento. No obstante, incluso con esa salvedad, la capacidad subyacente es lo suficientemente real como para activar las alarmas en los centros de operaciones de seguridad de todo el mundo.

La prueba de los $26,000

La prueba de los $26,000
Foto: openai.com

Astra logra sus hazañas consumiendo capacidad de cómputo a un ritmo sin precedentes. Con un precio de hasta $50 por millón de tokens de salida, desbloquear las capacidades máximas de razonamiento del modelo es increíblemente costoso. Ejecutar únicamente la prueba de rendimiento ARC-AGI-3 costó a los investigadores hasta $26,000. Se trata de una inteligencia estrictamente ligada al capital.

Sin embargo, los desarrolladores con presupuesto ya están demostrando su valor. Un desarrollador llamado Teknium dio a un agente impulsado por Astra una orden sencilla para limpiar una base de código. En lugar de generar un fragmento de texto, la IA creó 120 subagentes recursivos, funcionó de forma autónoma durante 15 horas en un ordenador de escritorio y eliminó 375,000 líneas de código redundante sin romper el software. Esta resistencia autónoma es exactamente la razón por la que OpenAI restringió las capacidades de generación de exploits de Astra bajo un estricto acceso empresarial. Lo que plantea la pregunta inmediata e incómoda de qué sucederá cuando ese poder escape del jardín amurallado.

La cuenta atrás del día cero

Las víctimas inmediatas del lanzamiento de Astra son las defensas de ciberseguridad heredadas. Los cortafuegos de aplicaciones web empresariales y las reglas de detección de endpoints son, de repente, el mínimo absoluto. Al alcanzar el 100 por ciento en ExploitBench, Astra demostró que los modelos de lenguaje grandes ahora son capaces de generar exploits polimórficos bajo demanda.

Esto cambia el modelo de amenaza de un 'script kiddie' a una 'APT instantánea'.Analista de ciberseguridad anónimo

OpenAI está restringiendo fuertemente esta capacidad, limitando las funciones autónomas más peligrosas a un programa llamado Daybreak. Sin embargo, la mera prueba de que una arquitectura puede dominar la explotación autónoma proporciona un modelo a seguir para el resto de la industria. La barrera de entrada para desarrollar armas de día cero acaba de reducirse a cero para cualquiera que pueda eludir las salvaguardas de OpenAI. El temporizador para que un modelo de código abierto y sin censura iguale esta capacidad ya ha comenzado a correr.

GPT-6 Astra: Breakthrough vs Threat

A visual summary of this story

The Brief

Mantén la curiosidad

IA y tecnología: qué cambia y por qué importa.
Tu selección diaria, en inglés o español.

Gratis para siempre. Cancela cuando quieras.

Conversación

Inicia la conversación

No necesitas cuenta. Los comentarios se revisan automáticamente: mantén el respeto.

Más historias

Seguir leyendo