The Specialty News
IA

Moonshot AI reinventa el Transformer con Attention Residuals

Al sustituir las conexiones estáticas por una atención dinámica y dependiente de la entrada, Moonshot afirma haber logrado una mejora de 1.25x en la eficiencia de cómputo.

Por The Specialty News DeskEditado por 5 min read
Moonshot AI reinventa el Transformer con Attention Residuals
Foto: freepik.com

Durante años, la "conexión residual" ha sido la columna vertebral silenciosa de los principales LLM, actuando como una autopista fija que transporta datos a través de una red. Pero Moonshot AI acaba de señalar que esta autopista está sufriendo un embotellamiento. Al introducir "Attention Residuals", pasan de una suma estática a un sistema de recuperación dinámico y selectivo que promete hacer que los modelos sean tanto más eficientes como más inteligentes a la hora de procesar razonamientos complejos de contexto largo.

Rompiendo el cuello de botella de la suma

En las arquitecturas Transformer tradicionales, las conexiones residuales suman la salida de cada capa a la siguiente utilizando pesos fijos. A medida que los modelos se vuelven más profundos, los investigadores han observado un problema persistente: la dilución de la información. Debido a que la red fuerza una acumulación uniforme de los estados ocultos, las señales de las primeras capas a menudo quedan sepultadas bajo el ruido de la pila más profunda. Esto provoca inestabilidad y obliga a las capas individuales a generar estados ocultos más grandes y saturados solo para seguir siendo relevantes.

El AttnRes de Moonshot sustituye esta aritmética rígida por un mecanismo de atención aprendido y dependiente de la entrada. En lugar de limitarse a sumar información, cada capa emplea un vector de "pseudo-consulta" para elegir qué representaciones anteriores necesita realmente. Al dividir estas capas en unidades "Block AttnRes", el equipo ha transformado un problema de memoria inmanejable en una operación $O(Nd)$ viable. El resultado es una arquitectura que se comporta menos como una tubería estática y más como un filtro inteligente, recuperando exactamente la información adecuada para la tarea en cuestión.

El futuro de las redes más profundas y eficientes

El futuro de las redes más profundas y eficientes
Foto: Michael Dziedzic / Unsplash

La conclusión más atractiva de este avance es su enorme eficiencia. La validación de Moonshot en su arquitectura Kimi Linear de 48B muestra una ventaja de cómputo de 1.25x, lo que significa que un modelo que utiliza AttnRes puede rendir al mismo nivel que un modelo de referencia que requiere un 25% más de potencia de entrenamiento. Mejor aún, este aumento del rendimiento viene acompañado de una sobrecarga de latencia insignificante de menos del 2%, lo que lo convierte en un reemplazo directo muy práctico para los sistemas a gran escala existentes.

Al igual que pasamos de las RNN a los Transformers para lograr una mejor atención a lo largo del tiempo, es posible que estemos entrando en una era en la que apliquemos esa misma atención selectiva a la profundidad de nuestros modelos.

Esto no es solo una aceleración marginal; representa un cambio fundamental en la forma en que concebimos la profundidad de las redes. Al igual que pasamos de las RNN a los Transformers para lograr una mejor atención a lo largo del tiempo, es posible que estemos entrando en una era en la que apliquemos esa misma atención selectiva a la profundidad de nuestros modelos. Si AttnRes resiste el escrutinio de la industria en general, proporcionará un modelo para construir redes neuronales más profundas y estables que no se conviertan en trampas de eficiencia, abriendo un camino claro para modelos de IA más capaces y basados en la lógica.

Rewiring the Transformer

A visual summary of this story

The Brief

Mantén la curiosidad

IA y tecnología: qué cambia y por qué importa.
Tu selección diaria, en inglés o español.

Gratis para siempre. Cancela cuando quieras.

Conversación

Inicia la conversación

No necesitas cuenta. Los comentarios se revisan automáticamente: mantén el respeto.

Más historias

Seguir leyendo