La máquina que adivina la próxima palabra: LLM
Un gran modelo de lenguaje, LLM para abreviar. Escribe, traduce y hasta ayuda a programar, así que parece magia, ¿verdad? Pero mira dentro y es sorprendentemente simple. Lo que hace un LLM es en realidad una sola cosa. Mira las palabras hasta ahora y adivina la palabra que viene después. Encadena esas conjeturas palabra por palabra y obtienes una frase larga, una respuesta. ¿Eso es todo? Comprobémoslo juntos.
Adivina la palabra que sigue
Piensa en escribir en tu telefono.
Tocas una palabra y el teclado
sugiere en silencio la que podria venir.
Un LLM hace en verdad ese mismo trabajo.
Solo que es asombrosamente bueno en ello.
Lee todas las palabras hasta ahora
y elige la proxima palabra mas plausible.
Engancha esa palabra
y luego elige la palabra siguiente.
Toca una palabra para continuar la frase. Cada toque muestra candidatas a la proxima palabra con sus probabilidades. Palabra a palabra, la frase crece.
Sorprendente, ¿no?
Apenas eligio la proxima palabra,
y aparecio una frase con sentido.
El secreto es el numero junto a cada candidata.
Ese numero es una probabilidad.
Es un puntaje que muestra cuan probable
es que una palabra dada venga despues.
El LLM elige una alta entre ellas.
Veamos que significa exactamente despues.
Elige una por probabilidad
La probabilidad no es dificil.
Para cada posible proxima palabra
asigna un puntaje de cuan plausible es.
Cuanto mayor el puntaje, mas plausible.
Por ejemplo, tras el cielo esta despejado
una palabra como brillante puntua alto
mientras que oscuro puntua bajo.
El LLM suele elegir la de mayor puntaje.
Luego engancha esa palabra a la frase.
En cada paso, toca la palabra con mayor probabilidad para elegirla. La palabra elegida se une a la frase y pasas al siguiente paso. Las candidatas estan prefijadas, asi que aparecen igual cada vez.
Cada vez que elegiste una palabra
la frase crecio una casilla.
Luego releyo la frase mas larga
y ofrecio nuevas candidatas siguientes.
Elige, engancha, elige de nuevo.
Repite este pequeno gesto incontables veces
y obtienes parrafos y respuestas largas.
La escritura de un LLM no surge entera;
se apila paso a paso como esto.
Cambia al mirar el contexto
Pero las probabilidades de la proxima palabra no son fijas.
Segun que palabras vinieron antes,
cambian drasticamente en un instante.
Tras tengo hambre, palabras de comida encajan;
tras el barco en el puerto, palabras de mar
se vuelven las plausibles.
Con la misma palabra barco, otro contexto
cambia por completo lo que sigue.
Esa capacidad de elegir que mirar es la atencion.
Toca para cambiar la palabra anterior. Aun en el mismo lugar, otro contexto reordena por completo las barras de probabilidad de la proxima palabra. Eso significa que la atencion mira atras.
Solo cambio una palabra anterior,
y las probabilidades siguientes se voltearon por completo.
Aqui esta el secreto de por que un LLM parece listo.
Examina todo el contexto previo
y elige la proxima palabra que encaja con la situacion.
Por eso, aun con la misma pregunta,
la respuesta cambia bastante
segun que contexto pongas primero.
Leer bien el contexto es, de hecho, la habilidad.
De una sola surgen muchas
Aqui pasa algo asombroso.
Solo lo hicimos bueno en adivinar la proxima palabra,
y capacidades que nadie pidio se suman.
Dado un texto largo y luego sigue resumen,
continua de forma plausible con un resumen;
dado coreano y luego sigue ingles,
continua con una traduccion;
dado un problema y luego sigue codigo,
hasta logra programar.
Las capacidades que aparecen solas se llaman emergentes.
Toca para cambiar la capacidad. Resumen, traduccion y codigo nacen del mismo adivinar la proxima palabra. Solo cambia el flujo inicial; el trabajo de la maquina es uno.
Solo cambio el boton, y la tarea parecio distinta.
Pero por dentro, todo es lo mismo.
Mira el inicio y adivina la proxima palabra.
Pulir esta unica cosa con vastas cantidades de texto
hizo que muchas capacidades vinieran de regalo.
Aun asi, recuerda una cosa con seguridad.
Un LLM no conoce la verdad;
solo elige la proxima palabra mas plausible.
Por eso puede equivocarse sonando seguro.
Resumamos
Reunido en una linea, es esto.
Un LLM mira el contexto previo
y adivina la proxima palabra por probabilidad.
Puntua cada candidata y elige una alta,
enganchando palabra a palabra para crear texto largo.
Cuando cambian las palabras anteriores, cambian las probabilidades,
y elegir que mirar atras es la atencion.
Volverse bueno en esta unica cosa
hizo emerger resumen, traduccion y codigo.
Solo no olvides que elige plausibilidad, no verdad.
Toca los puntos clave en orden para repasar. (adivina la proxima palabra -> elige por probabilidad palabra a palabra -> cambia con el contexto, atencion -> emergen muchas capacidades)
Ahora ves lo que un LLM realmente es.
No magia, sino una maquina que adivina
la proxima palabra por probabilidad.
Hacer algo simple bien a una escala enorme
dejo florecer capacidades inesperadas.
De hecho, un modelo como yo,
hablando contigo ahora mismo, es justo esa maquina.
Pero perseguir solo plausibilidad
a veces lo hace equivocarse con confianza.
Luego exploremos estos limites y la responsabilidad.