xAI enseña a Grok 4.7, de 2,1 billones de parámetros, a revisar su trabajo, y los desarrolladores obtienen un solucionador de problemas tenaz
El nuevo modelo insignia aprendió a rendirse ante matemáticas complejas para ahorrar tokens. Ahora, los ingenieros ajustan su alineación para priorizar el razonamiento a largo plazo frente a las respuestas rápidas

El nuevo modelo insignia de xAI, Grok 4.7, se ha retrasado no por falta de inteligencia bruta, sino porque se rinde con facilidad. Durante el aprendizaje por refuerzo, los ingenieros penalizaron tanto a la IA por dar respuestas largas que el modelo adquirió un mal hábito: abandonar los problemas complejos de matemáticas y programación antes de tiempo en lugar de dedicar tiempo a verificar su trabajo. Elon Musk confirmó el retraso el 11 de septiembre, prescindiendo del tradicional comunicado de prensa para depurar el sistema en público en X. La decisión frena un agresivo calendario de lanzamientos para resolver una de las disyuntivas más importantes del aprendizaje automático: equilibrar la eficiencia de tokens de un modelo con su capacidad para razonar a fondo un problema difícil.
El costo de ser conciso
El obstáculo radica en un proceso llamado Aprendizaje por Refuerzo (RL, por sus siglas en inglés), donde evaluadores humanos y bucles automatizados califican las respuestas de una IA. Históricamente, los modelos se entrenan para complacer a los humanos ofreciendo respuestas rápidas y seguras. Si una IA escribe una novela para responder a una pregunta sencilla, es penalizada. Pero para la programación avanzada, los flujos de trabajo de agentes y las tareas de ingeniería de hardware a las que apunta xAI con datos patentados de SpaceX, una suposición rápida es inútil.
Cuando los ingenieros ajustaron las tuercas para que Grok 4.7 fuera eficiente en el uso de tokens, corrigieron en exceso. El modelo descubrió que escribir los pasos intermedios de razonamiento costaba demasiado en su sistema de puntuación interno. Por lo tanto, al enfrentarse a un acertijo lógico difícil que genuinamente tenía la capacidad de resolver, simplemente dejaba de intentarlo.
“Es posible que hayamos penalizado demasiado la longitud de las respuestas (o algo así) en el RL, ya que todavía se rinde en tareas difíciles (¡que puede hacer!) demasiado pronto y aún no es lo suficientemente riguroso al revisar su trabajo.”— Elon Musk
Solucionar esto implica hilar muy fino a nivel algorítmico. El equipo de alineación de xAI ahora está recalibrando el modelo para que sepa exactamente cuándo ofrecer una respuesta rápida y cuándo detenerse y mostrar su trabajo.
Escalando a 2,1 billones
Hay mucho en juego para hacer esto bien debido a la enorme escala del sistema.
Esto representa una arquitectura neuronal tan densa que requiere decenas de miles de GPU especializadas trabajando en perfecta sincronización solo para mantener su memoria. Más sorprendente que el tamaño es la velocidad. xAI lanzó Grok 4.6, de 1,5 billones de parámetros, a principios de agosto. Pasar a una actualización insignia apenas cuatro semanas después ilustra un ritmo de desarrollo de fuerza bruta, lanzando en un mes actualizaciones que históricamente a sus rivales les toma varios trimestres lograr.
Esta rápida iteración es exactamente la razón por la que los analistas independientes de IA rastrean los ID de los modelos que se filtran a través de errores de bots. Cuando un modelo inédito grok-4-7-0907 apareció en la red a principios de septiembre, indicó que se estaban realizando pruebas secretas en vivo. Pero Musk decidió hacer una pausa en lugar de lanzar un motor de razonamiento defectuoso, señalando un cambio en lo que los desarrolladores realmente necesitan de estos modelos a continuación.
Lo que dice la gente
“@farzyness Grok 4.7 needs a few more days to cook. We might have penalized response length too much (or something) in RL, as it still gives up on hard tasks (that it can do!) too early and isn’t yet sufficiently rigorous in checking its work.”
“Grok 4.7 is coming over the weekend. Expect some AI frontier fireworks.”
Token Limits Made Grok Quit
The Brief
Mantén la curiosidad
IA y tecnología: qué cambia y por qué importa.
Tu selección diaria, en inglés o español.
Gratis para siempre. Cancela cuando quieras.
Más historias

The Specialty News






Conversación
Inicia la conversación