MiniMax-M2.7 usa aprendizaje por refuerzo autónomo para mejorarse a sí mismo
El nuevo modelo insignia de la firma de IA con sede en Shanghái gestionaría hasta el 50% de su propio flujo de desarrollo, según la compañía.

El futuro del desarrollo de software podría parecerse cada vez menos a programadores humanos tecleando sin parar y cada vez más a modelos de IA refinando su propia arquitectura digital. MiniMax, líder de IA con sede en Shanghái, acaba de lanzar su nuevo buque insignia, M2.7, y el hallazgo no es solo su velocidad o su lógica: es que el modelo desempeñó un papel activo en su propia construcción. Al integrarse en su propio arnés de aprendizaje por refuerzo, M2.7 ha comenzado, en esencia, el proceso de diseñar su propia evolución.
De un desarrollo liderado por humanos a uno autoparticipativo
En el corazón del lanzamiento de M2.7 está el alejamiento del entrenamiento tradicional de modelos, liderado exclusivamente por humanos. Los ingenieros de MiniMax usaron el propio modelo para construir decenas de habilidades complejas, actualizar su memoria interna y refinar sus ciclos de aprendizaje por refuerzo (RL). No se trata solo de velocidad: se trata de trasladar a la propia IA la carga de las pruebas iterativas. La compañía informa que M2.7 gestiona entre el 30% y el 50% de su propio flujo de trabajo durante el proceso de iteración, lo que crea un bucle de retroalimentación que acelera de forma notable los ciclos de despliegue.
Las métricas de desempeño sugieren que este enfoque está dando frutos. M2.7 obtuvo una puntuación de 56,22% en el benchmark SWE-Pro, una prueba exigente de capacidades de ingeniería de software, y alcanzó un puntaje ELO de 1.495 en GDPval-AA, el más alto entre los modelos de código abierto en el momento de su lanzamiento. Con una tasa de adherencia del 97% en 40 habilidades complejas, el modelo está claramente optimizado para el trabajo pesado de las tareas agénticas: razonamiento, uso de herramientas y programación de punta a punta.
El camino por delante para la ingeniería autónoma

Aunque los resultados internos de MiniMax son impresionantes, la comunidad tecnológica espera, con razón, una validación independiente que confirme estas cifras frente a pesos pesados globales como OpenAI. El debate sobre si esto representa una verdadera 'autoevolución' o simplemente un ciclo de aprendizaje por refuerzo automatizado y muy eficiente ya se está calentando. En cualquier caso, las implicaciones para el futuro del desarrollo de la IA son profundas. Estamos presenciando el nacimiento de las 'canalizaciones de agentes autónomos', donde los sistemas de IA tratan su propio desarrollo como un proceso de integración continua.
“lo más peligroso que se puede hacer es subestimar las ganancias de eficiencia cuando una IA empieza a ayudar a escribir su propio código.”
Este giro nos acerca a un mundo en el que los sistemas de IA no son solo herramientas que usamos, sino sistemas que mantienen y mejoran sus propias capacidades. Si MiniMax logra demostrar la escalabilidad de este modelo más allá de los benchmarks existentes, creará una plantilla para un desarrollo rápido y rentable que podría reducir drásticamente la brecha entre la investigación en AGI y las aplicaciones de consumo. La lección aquí es clara: lo más peligroso que se puede hacer es subestimar las ganancias de eficiencia cuando una IA empieza a ayudar a escribir su propio código.
The Model That Builds Itself
The Brief
Mantén la curiosidad
IA y tecnología: qué cambia y por qué importa.
Tu selección diaria, en inglés o español.
Gratis para siempre. Cancela cuando quieras.
Más historias

The Specialty News





Conversación
Inicia la conversación