xAI entrena Grok 4.8 de 2.5 billones de parámetros en C++ y abre la puerta a una inferencia más barata
La pila de software bare-metal reemplaza las herramientas estándar de entrenamiento de IA, lo que permite a los desarrolladores ejecutar modelos de agentes sin la habitual penalización de latencia

Apenas unas horas después de respaldar públicamente un ensayo que instaba a la industria de la IA a pisar el freno, Elon Musk anunció con calma que su equipo estaba pisando el acelerador a fondo. Durante un fin de semana de septiembre, Musk reveló que xAI está concluyendo el preentrenamiento de Grok 4.8, un modelo de 2.5 billones de parámetros. La escala es notable, pero el avance técnico radica en cómo se construyó. xAI descartó el manual de software estándar de la industria y escribió una pila de entrenamiento completamente nueva en C++ para comunicarse directamente con el hardware de NVIDIA.
Descartando el manual de Python
La mayor parte del desarrollo de IA depende de marcos de trabajo de Python establecidos como PyTorch. El lenguaje es muy flexible y se beneficia de un ecosistema global colaborativo, pero inherentemente actúa como un traductor. Añade una sobrecarga de software, traduciendo el código legible por humanos en instrucciones antes de que lleguen a las GPU. xAI decidió eliminar al traductor por completo. Al mapear su software exactamente al hardware NVIDIA GB300, el equipo de ingeniería eliminó las capas de abstracción que normalmente ralentizan el entrenamiento de los modelos y los tiempos de respuesta. El objetivo es la eficiencia bare-metal.
Para poner esa escala en perspectiva, 2.5 billones de parámetros es aproximadamente un 67 por ciento más grande que el modelo líder actual de xAI, Grok 4.6. Es el equivalente a tomar una metrópolis moderna en expansión y acoplar una ciudad completamente nueva en sus bordes, lo que requiere una sincronización perfecta a través de millones de nuevas vías. Construir esto a nivel de hardware es un enorme riesgo de ingeniería. Si la pila en C++ funciona, la industria tendrá que replantearse cómo construye los modelos, pero la computación bruta es solo la primera fase del viaje.
La realidad del refuerzo
Lograr que 2.5 billones de parámetros absorban internet es un logro de pura matemática y escala de computación. Sin embargo, hacer que esos parámetros realmente escuchen a un usuario requiere Aprendizaje por Refuerzo. Esta es la fase exacta en la que Grok 4.8 acaba de entrar.
“Grok 4.8, que es un modelo de 2.5T entrenado con nuestra nueva pila de software en C++, terminará su entrenamiento esta semana y comenzará el RL.”— Elon Musk
Este anuncio llegó con una dosis de ironía. Apenas unas horas antes, Musk había estado de acuerdo públicamente con el CEO de Anthropic, Dario Amodei, quien publicó un ensayo advirtiendo sobre la automejora recursiva y pidiendo una desaceleración en toda la industria. Sin embargo, la pila propietaria en C++ de xAI ahora tiene que demostrar que puede manejar la depuración compleja y poco glamurosa requerida para ajustar un modelo de este tamaño a alta velocidad. Grok 4.7, el predecesor de 2.1 billones de parámetros, incumplió recientemente su objetivo de lanzamiento porque el equipo necesitaba más tiempo para arreglar comportamientos multimodales como el procesamiento de imágenes. El retraso de Grok 4.7 demuestra que la alineación de modelos sigue siendo el obstáculo más difícil en la IA, pero resolver el cuello de botella de la computación abre una economía completamente nueva.
Acelerando la frontera
Si xAI lanza con éxito modelos construidos sobre esta pila bare-metal, los beneficios recaerán directamente en los desarrolladores. Musk ha señalado que este enfoque directo al hardware podría duplicar las velocidades de inferencia. Para los ingenieros de software que construyen agentes de IA, esto significa la capacidad de ejecutar modelos de codificación de clase frontera sin la latencia prohibitiva y los costos de computación que actualmente limitan las aplicaciones complejas. Un desarrollador que intente automatizar miles de revisiones de código podría de repente permitirse ejecutar la tarea localmente o a través de una API sin gastar una fortuna.
La industria en general observará de cerca el lanzamiento de Grok 4.8. xAI todavía necesita demostrar que puede lanzar de manera confiable los modelos que ya ha anunciado. Pero el giro técnico por sí solo es una señal clara de hacia dónde se dirige el sector. El enfoque de xAI demuestra que el próximo salto en capacidad no requiere esperar a la próxima generación de silicio. Todavía se pueden exprimir grandes ganancias de rendimiento de la ingeniería de software al eliminar la fricción en cómo nos comunicamos con los chips que ya tenemos.
Lo que dice la gente
“@techdevnotes Grok 4.8, which is a 2.5T model trained with our new C++ software stack, will finish training this week and start RL”
“@itslueul Grok 4.7 should be roughly on par with Opus 5.0, not 5.1. Better in some ways, worse in others. We need to fix multimodal performance. Grok 4.8 will be a noticeable improvement. Grok 4.9 is probably Astra/Fable class. Grok 5 maybe better than anything. We shall see.”
“Cuando Elon dice “esta semana termina el entrenamiento y arranca el RL”, históricamente tarda entre 3 y 6 semanas en salir. A veces más. Por ejemplo, el Grok 4.5 (1.5T): el 25 de mayo dijo “ya terminó el entrenamiento, en unos días RL, 2-3 semanas para soltarlo”. Y salió entre”
xAI's C++ Pivot Doubles AI Speed
The Brief
Mantén la curiosidad
IA y tecnología: qué cambia y por qué importa.
Tu selección diaria, en inglés o español.
Gratis para siempre. Cancela cuando quieras.
Más historias

The Specialty News





Conversación
Inicia la conversación