Cómo funciona un LLM
Un gran modelo de lenguaje, LLM para abreviar. Escribe, traduce y hasta ayuda a programar, así que parece magia, ¿verdad? Pero mira dentro y es sorprendentemente simple. Lo que hace un LLM es en realidad una sola cosa. Mira las palabras hasta ahora y adivina la palabra que viene después. Encadena esas conjeturas palabra por palabra y obtienes una frase larga, una respuesta. ¿Eso es todo? Comprobémoslo juntos.
Adivina la palabra que sigue
Piensa en escribir en tu teléfono.
Tocas una palabra y el teclado
sugiere en silencio la que podría venir.
Un LLM hace en verdad ese mismo trabajo.
Solo que es asombrosamente bueno en ello.
Lee todas las palabras hasta ahora
y elige la próxima palabra más plausible.
Engancha esa palabra
y luego elige la palabra siguiente.
Toca una palabra para continuar la frase. Cada toque muestra candidatas a la próxima palabra con sus probabilidades. Palabra a palabra, la frase crece.
Sorprendente, ¿no?
Apenas eligió la próxima palabra,
y apareció una frase con sentido.
El secreto es el número junto a cada candidata.
Ese número es una probabilidad.
Es un puntaje que muestra cuán probable
es que una palabra dada venga después.
El LLM elige una alta entre ellas.
Veamos qué significa exactamente después.
Elige una por probabilidad
La probabilidad no es difícil.
Para cada posible próxima palabra
asigna un puntaje de cuán plausible es.
Cuanto mayor el puntaje, más plausible.
Por ejemplo, tras el cielo está despejado
una palabra como brillante puntúa alto
mientras que oscuro puntúa bajo.
El LLM suele elegir la de mayor puntaje.
Luego engancha esa palabra a la frase.
En cada paso, toca la palabra con mayor probabilidad para elegirla. La palabra elegida se une a la frase y pasas al siguiente paso. Las candidatas están prefijadas, así que aparecen igual cada vez.
Cada vez que elegiste una palabra
la frase creció una casilla.
Luego releyó la frase más larga
y ofreció nuevas candidatas siguientes.
Elige, engancha, elige de nuevo.
Repite este pequeño gesto incontables veces
y obtienes párrafos y respuestas largas.
La escritura de un LLM no surge entera;
se apila paso a paso como esto.
Cambia al mirar el contexto
Pero las probabilidades de la próxima palabra no son fijas.
Según qué palabras vinieron antes,
cambian drásticamente en un instante.
Tras tengo hambre, palabras de comida encajan;
tras el barco en el puerto, palabras de mar
se vuelven las plausibles.
Con la misma palabra barco, otro contexto
cambia por completo lo que sigue.
Esa capacidad de elegir qué mirar es la atención.
Toca para cambiar la palabra anterior. Aun en el mismo lugar, otro contexto reordena por completo las barras de probabilidad de la próxima palabra. Eso significa que la atención mira atrás.
Solo cambió una palabra anterior,
y las probabilidades siguientes se voltearon por completo.
Aquí está el secreto de por qué un LLM parece listo.
Examina todo el contexto previo
y elige la próxima palabra que encaja con la situación.
Por eso, aun con la misma pregunta,
la respuesta cambia bastante
según qué contexto pongas primero.
Leer bien el contexto es, de hecho, la habilidad.
De una sola surgen muchas
Aquí pasa algo asombroso.
Solo lo hicimos bueno en adivinar la próxima palabra,
y capacidades que nadie pidió se suman.
Dado un texto largo y luego sigue resumen,
continúa de forma plausible con un resumen;
dado hola y luego sigue hello,
continúa con una traducción;
dado un problema y luego sigue código,
hasta logra programar.
Las capacidades que aparecen solas se llaman emergentes.
Toca para cambiar la capacidad. Resumen, traducción y código nacen del mismo adivinar la próxima palabra. Solo cambia el flujo inicial; el trabajo de la máquina es uno.
Solo cambió el botón, y la tarea pareció distinta.
Pero por dentro, todo es lo mismo.
Mira el inicio y adivina la próxima palabra.
Pulir esta única cosa con vastas cantidades de texto
hizo que muchas capacidades vinieran de regalo.
Aun así, recuerda una cosa con seguridad.
Un LLM no conoce la verdad;
solo elige la próxima palabra más plausible.
Por eso puede equivocarse sonando seguro.
Resumamos
Reunido en una línea, es esto.
Un LLM mira el contexto previo
y adivina la próxima palabra por probabilidad.
Puntúa cada candidata y elige una alta,
enganchando palabra a palabra para crear texto largo.
Cuando cambian las palabras anteriores, cambian las probabilidades,
y elegir qué mirar atrás es la atención.
Volverse bueno en esta única cosa
hizo emerger resumen, traducción y código.
Solo no olvides que elige plausibilidad, no verdad.
Toca los puntos clave en orden para repasar. (adivina la próxima palabra -> elige por probabilidad palabra a palabra -> cambia con el contexto, atención -> emergen muchas capacidades)
Ahora ves lo que un LLM realmente es.
No magia, sino una máquina que adivina
la próxima palabra por probabilidad.
Hacer algo simple bien a una escala enorme
dejó florecer capacidades inesperadas.
De hecho, un modelo como yo,
hablando contigo ahora mismo, es justo esa máquina.
Pero perseguir solo plausibilidad
a veces lo hace equivocarse con confianza.
Luego exploremos estos límites y la responsabilidad.