seegongsik
IA · cómo aprenden las máquinas
Qué significa de verdad que una máquina "aprenda"
En vez de escribir las reglas, dejamos que la máquina las encuentre desde ejemplos. De la estadística y la regresión a las neuronas, las redes y la retropropagación, y luego embeddings, atención, LLMs y generación, sigámoslo paso a paso.
18 / 18
01✓¿Qué significa aprender?
Un programa común funciona con reglas que una persona escribió una por una. Pero el mundo tiene tantas reglas que escribirlas todas es difícil. El aprendizaje automático da vuelta el camino. Muéstrale montones de ejemplos con la respuesta puesta, y la máquina halla el patrón común, la regla, en esos ejemplos por sí sola. Al principio se equivoca, pero con más ejemplos corrige dónde falló poco a poco y mejora. Con ese patrón pulido, hasta puede predecir una entrada nueva que nunca vio. En resumen, en vez de que una persona escriba las reglas, la máquina las halla de los ejemplos, corrige errores y predice cosas nuevas. Eso es aprender.
02✓Ver el mundo en números: el ojo de la estadística
La estadística es el ojo que resume muchos datos en pocos números. El primero es el promedio. Suma todo y divide por la cantidad para obtener el valor del medio, que dice más o menos dónde están los datos. El segundo es la dispersión. Dice cuán lejos se esparcen los puntos del medio. Estos dos van en pareja. Aun con el mismo promedio, una dispersión distinta significa datos completamente distintos. Un grupo apretado y uno muy esparcido pueden compartir el mismo medio y tener carácter distinto. También hay una precaución. Un punto lejano, un valor atípico, arrastra el promedio con facilidad. Así que no confíes solo en el valor del medio; mira también la dispersión y el punto suelto. En resumen, la estadística es ver los datos de un vistazo con dos números, el medio y la dispersión.
03✓Probabilidad: manejar la incertidumbre
La probabilidad pone lo probable que es algo en un número entre cero y uno. Cero significa que casi nunca pasa, uno que es casi seguro, y un medio es mitad y mitad. Con un dado o una moneda, si pruebas muchas veces, la proporción de cada resultado se acerca a la probabilidad verdadera. Una o dos veces oscila, pero más intentos la asientan. La posibilidad de que dos cosas pasen juntas se calcula multiplicando la de cada una, pues ambas deben ser probables para que el par lo sea. Y cuando las cosas no son seguras, elegimos el lado más probable. La IA hace lo mismo. No declara que sabe la respuesta; puntúa varios candidatos con probabilidades y elige el más probable. En resumen, la probabilidad maneja la incertidumbre como números para que elijamos el lado más probable.
04✓Trazar una recta entre puntos: regresión
La regresión traza una recta, la que mejor se ajusta, entre los puntos dispersos. Como esa recta es y=ax+b, puedes predecir el resultado de una entrada nueva. Solo dos cosas fijan la recta. La pendiente a decide cuánto sube el resultado cuando la entrada sube en uno, y la ordenada b decide dónde queda la recta arriba o abajo. La recta que mejor se ajusta es la del menor desajuste total, la suma de distancias de los puntos a la recta. Reduces el desajuste a ojo y te acercas a esa recta. Estos dos números, pendiente a y ordenada b, pasan luego tal cual al peso y al sesgo de una neurona.
05✓Clasificacion: decir a que grupo pertenece
La clasificacion trata de decir a que grupo pertenece algo. Donde la regresion adivina un solo valor, la clasificacion responde cual de los grupos es. El metodo es simple. Traza una linea de frontera entre los dos grupos para dividirlos en dos lados. Cuando llega un punto nuevo, solo mira de que lado de la frontera cae y su grupo queda decidido. Sin medir, una posicion lo resuelve. Si hay tres o mas grupos, traza mas fronteras para dividir en mas regiones. En resumen, traza una frontera entre los puntos y ordena un punto nuevo por el lado de la frontera en que esta, eso es la clasificacion.
06✓Pérdida: medir cuánto se equivoca el modelo
La perdida es un solo numero que mide cuanto se equivoca el modelo. Por cada punto hay una brecha entre la prediccion y la respuesta verdadera, una distancia vertical. Suma todas esas distancias y cuanto se equivoca el conjunto se reune en un numero. Esa es la perdida. Una perdida grande significa que la linea se aleja de los puntos, una pequena que encaja bien. Asi que hacer un buen modelo es lo mismo que hacer pequena la perdida. Mueve la linea de un lado a otro y elige la direccion donde el numero de perdida baja. Reducir la perdida asi es justo lo que es entrenar. Luego veremos como hallar en que direccion reducir la perdida.
07✓Corregir poco a poco: descenso de gradiente
El descenso de gradiente es una forma de bajar la pérdida sintiendo la pendiente y corrigiendo el valor un paso cada vez hacia el lado más bajo. La curva de pérdida tiene forma de valle, más baja en el centro, y desde donde estamos leemos la pendiente bajo los pies y movemos el valor hacia el lado que baja. El tamaño de ese paso es el paso, es decir, la tasa de aprendizaje. Si el paso es muy grande pasa de largo el fondo y rebota al otro lado; si es muy pequeño baja pero despacio. Repite pasos con un paso sensato y te acercas al fondo del valle, el punto de menor pérdida. En resumen, siente la pendiente y baja poco a poco, y elige bien el paso; eso es el descenso de gradiente.
08✓Una celda que imita al cerebro, la neurona
Una neurona artificial multiplica cada entrada por un peso y las suma todas. Esta forma es el mismo ax+b que vimos en la regresion. La pendiente a de alli es el peso aqui. Un peso grande escucha fuerte esa entrada, uno pequeno apenas la oye. Si la suma pasa un umbral la neurona se enciende (1), si no, queda apagada (0). Al principio los pesos son toscos, asi que falla a menudo. Entonces, como en el descenso por gradiente, corrige los pesos un poco segun cuanto fallo. Eligiendo si subir o bajar y dando un paso por vez, la neurona acierta cada vez mejor. En resumen, multiplica entradas por pesos y suma, dispara por un umbral, y ajusta cuando falla, asi aprende una neurona.
09✓Apilar neuronas: la red neuronal
Una red neuronal son muchas neuronas simples apiladas y conectadas en capas. Cada capa toma la salida de la capa anterior como entrada y capta una característica mayor. La capa frontal ve piezas pequeñas, y una capa posterior junta esas piezas en una forma mayor. Una cosa es esencial. Entre capas debe haber un paso no lineal que doble la señal. Sin un paso que doble, solo repitiendo sumas, por muchas capas que apiles se colapsan en una sola línea recta, igual que una capa. El paso que dobla es lo que hace que apilar valga la pena, así la red puede aprender fronteras complejas como curvas. En resumen, apila neuronas en capas y pon un paso que dobla entre ellas, y la red aprende patrones complejos. Eso es una red neuronal.
10✓Rastrear el error hacia atras: la retropropagacion
La retropropagacion es como una red neuronal se corrige cuando esta equivocada, rastreando el error hacia atras. Primero hace fluir las senales hacia adelante para dar una prediccion, luego la compara con la respuesta correcta y mide cuanto se equivoco como una perdida. Ahora viene lo esencial. Envia esa perdida hacia atras, de la salida hacia la entrada, y calcula la parte de cada peso, cuanto contribuyo al error. Es como seguir las fichas de domino al reves. Por ultimo ajusta cada peso por descenso de gradiente en proporcion a su parte. Los pesos con una parte grande cambian mucho, los de parte pequena cambian poco. Repite este ciclo de predecir adelante, rastrear atras y ajustar incontables veces, y las predicciones de la red se acercan a la respuesta correcta. En resumen, la retropropagacion rastrea el error hacia atras para repartir la culpa, y corrige cada peso en esa medida.
11✓Memorizar frente a entender de verdad: el sobreajuste
El sobreajuste es cuando un modelo memoriza los datos de entrenamiento y por eso se vuelve débil con datos nuevos. Una curva ondulada que pasa por cada punto saca un cien en entrenamiento, pero cuando llega un punto nuevo falla por mucho. Entender de verdad es captar el patrón general que recorre el conjunto, no cada punto suelto. Por eso dividimos los datos en tres. Aprendemos con los datos de entrenamiento, hacemos una revisión intermedia con los de validación, y guardamos los de prueba ocultos hasta el final, mirados una sola vez. Hacerlo bien con datos que nunca vio es lo que significa habilidad real. Un modelo demasiado simple no capta el patrón (subajuste), y uno demasiado complejo solo memoriza (sobreajuste). El punto justo entre ambos generaliza mejor. En resumen, haz que capte patrones en vez de memorizar, y mide la habilidad con datos que no ha visto.
12✓Buenos ingredientes hacen buena IA: los datos
La capacidad de una IA depende de sus datos tanto como de su modelo, quizá más. Primero, basura entra, basura sale. Si aprende de datos mal etiquetados o sesgados, la máquina aprende fielmente también esos defectos. Segundo, dale ingredientes limpios y equilibrados y la misma máquina aprende bien. Tercero, hay que elegir características que encajen con el problema. Para adivinar precios de casas, el área o la ubicación ayudan, pero el color de la puerta no. Las características irrelevantes solo estorban. Cuarto, los buenos datos son mejores en mayor cantidad. Con más ejemplos, la máquina se deja llevar menos por casualidades y capta el patrón real. En resumen, datos limpios y sin sesgo, descritos con características que encajan, dados en abundancia, son la base de una buena IA.
13✓Ojos para imagenes: la CNN
Una CNN es una red neuronal que mira imagenes. Primero, una foto es en realidad una rejilla repleta de numeros de brillo. Brillante es un numero grande, oscuro uno pequeno. Una CNN coloca un filtro pequeno, un panel como una lupa, sobre una ventana de la imagen y puntua si la caracteristica que busca esta ahi. Deslizar el mismo filtro por la rejilla paso a paso construye un mapa de caracteristicas que la halla este donde este en el cuadro. Un cambio de posicion no le molesta, pues el mismo filtro hace la busqueda. Y al apilar muchas de esas capas, la capa frontal capta bordes pequenos, la de arriba junta bordes en un ojo o una nariz, y una mas alta los junta en un rostro entero. Cuanto mas subes, mas abstractas las caracteristicas. En resumen, ve la foto como rejilla de numeros, escanea con filtros pequenos para hallar caracteristicas, y apila esas capas para subir la abstraccion. Eso es una CNN.
14✓Palabras en numeros: embeddings
El embedding convierte palabras en coordenadas de significado. Una coordenada es solo un grupo de numeros, asi que una computadora puede manejarla. La promesa clave es colocar juntas las palabras de significado parecido. Asi king y queen, perro y gato se agrupan cerca, mientras las palabras sin relacion quedan lejos. Como son coordenadas, puedes sumarlas y restarlas, y curiosamente esa cuenta lleva significado. Toma king, resta man, suma woman, y caes cerca de queen. Y este truco no es solo para palabras. Imagenes, sonidos, hasta usuarios pueden volverse coordenadas igual, asi que mantener cerca lo parecido deja a la computadora medir la similitud como distancia. En resumen, convertir palabras en coordenadas y agrupar los significados parecidos es el embedding, y es el primer paso de la computadora hacia manejar el significado.
15✓Centrarse en lo que importa: la atención
La atención es la destreza de centrarse más en las palabras que importan para la palabra en la que estás, dentro de una frase. En vez de mirar cada palabra por igual, da un peso mayor a las palabras más relevantes. Reúne todos estos pesos y los repartes para que sumen uno. Así, una misma palabra cambia su lectura cuando cambia su entorno. Pon 'eat' junto a 'Apple' y la coordenada de significado se desliza hacia la fruta; pon 'stock' y se desliza hacia la empresa. Por esto el contexto decide el sentido de una palabra ambigua. En resumen, céntrate más en lo que importa, reparte ese foco como pesos y deja que el contexto decida el significado. Eso es la atención.
16✓La máquina que adivina la próxima palabra: LLM
Un LLM es una máquina que mira el contexto previo y adivina la próxima palabra por probabilidad. Para cada palabra candidata que podría venir, puntúa lo plausible que es como una probabilidad, y luego elige una alta. Engancha la palabra elegida al final de la frase, y con la frase más larga adivina de nuevo la próxima palabra. Repitiendo esto palabra por palabra, construye un texto largo. Cuando cambian las palabras anteriores, las probabilidades de la próxima palabra también cambian, y esa capacidad de elegir qué contexto previo mirar es justo la atención que aprendiste antes. Y como fue entrenado con enormes cantidades de texto para hacer bien esta única cosa, surgieron capacidades que nadie pidió. Resume, traduce y programa. Esas capacidades que aparecen por sí solas se llaman emergentes. Pero recuerda. Un LLM no conoce la verdad; solo elige la próxima palabra más plausible. Por eso puede equivocarse con confianza. Sus límites se ven en la próxima lección.
17✓Crear algo nuevo: la IA generativa
La IA generativa es una IA que crea algo nuevo a partir de los patrones que aprendió. No copia algo memorizado; construye combinaciones nuevas con patrones captados en incontables ejemplos. Y no solo puede crear texto. También puede crear imágenes, música y video. Por eso la IA generativa es una palabra más amplia que un LLM que escribe texto. Para crear una imagen suele partir de un ruido granulado. A medida que limpia esos puntos borrosos poco a poco, la forma de una imagen va surgiendo. Y una persona da indicaciones. Escribir con palabras qué crear se llama un prompt. Aun con la misma IA, cambiar el prompt cambia la dirección del resultado. En resumen, la IA generativa crea cosas nuevas con patrones aprendidos, crea no solo texto sino también imágenes y música, construye una imagen limpiando desde el ruido, y toma su dirección de un prompt.
18✓IA lista, IA responsable
La IA es potente pero no perfecta. Primero, como la IA aprende de datos, si los datos se inclinan a un lado las decisiones de la IA tambien se inclinan. Eso es el sesgo. Segundo, como la IA encadena palabras plausibles por probabilidad, puede inventar con seguridad, como si fueran ciertas, cosas que no sabe. Eso es la alucinacion, por eso hay que verificar siempre los hechos recientes y las fuentes. Tercero, la misma tecnologia puede usarse para el bien o para el dano. No es la herramienta en si, sino la forma de usarla la que decide lo bueno o lo malo. Por eso hace falta una IA responsable. Las personas deben revisar los resultados, ser transparentes sobre como se construyo, y vigilar si es justa para todos. En resumen, conocer los limites del sesgo, la alucinacion y el mal uso, y usarla con una persona que verifica, eso es la IA responsable.