seegongsik
Mis palabras
IA

Ojos para imagenes: la CNN

Antes vimos una red neuronal apilar neuronas en capas para aprender patrones complejos. Pero una sola foto tiene decenas de miles de puntos. Aplanarla en una fila para una red comun es demasiado, y el mismo gato corrido un poco se vuelve una entrada totalmente distinta. Por eso surgio un metodo que escanea partes pequenas para hallar caracteristicas, igual que nuestros ojos. Esa es la red que mira imagenes, la CNN.

01

Una foto es en realidad una rejilla de numeros

A nuestros ojos solo parece una imagen.
Pero para dar una foto a una computadora
tenemos que convertirla en numeros.
Mira muy de cerca una foto
y veras puntos diminutos, pixeles, en rejilla.
Cada punto guarda su brillo como un numero.
Un punto claro es un numero grande, uno oscuro pequeno.
Asi que una sola foto
es una rejilla con un numero de brillo en cada celda.

A nuestros ojos es solo una imagen

Toca la imagen para acercar. De cerca, cada punto guarda un numero de brillo, asi que ves que la foto es una rejilla de numeros.

Al acercar, aparecieron los numeros.
Celdas claras son numeros grandes, oscuras pequenos.
Una persona ve la forma de un vistazo,
pero para la computadora es solo una tabla de numeros.
Entonces entre todos estos numeros,
como puede hallar una caracteristica
como un borde o una curva?
Ver todo a la vez es demasiado,
asi que estudia partes pequenas una a una.

02

Halla una caracteristica con un filtro pequeno

La herramienta que halla una caracteristica es el filtro.
Un filtro es un panel pequeno, mucho menor que la rejilla.
Es como poner una lupa en un punto.
Por ejemplo, un filtro que halla un borde vertical
prefiere un patron oscuro a la izquierda, claro a la derecha.
Coloca el filtro sobre una ventana de la imagen
y mira cuanto encaja con los numeros de ahi.
Si el patron calza bien, la puntuacion es alta,
y si no calza, es baja.

1
1
8
8
8
2
1
9
8
7
1
2
8
9
8
1
1
7
8
9
2
1
8
8
8
filtro de borde vertical
oscuroclaro
puntuacion: -
Toca una ventana de la rejilla para poner el filtro

Coloca el filtro en distintas ventanas y mira la puntuacion. Donde el parche se parece al filtro (oscuro a la izquierda, claro a la derecha), la puntuacion es alta, lo que dice que hay un borde vertical.

Cada punto que probaste dio otra puntuacion.
Donde el patron calzaba, era alta.
Eso dice que ahi hay un borde vertical.
Una cosa importa mas.
Dondequiera que pongas el mismo filtro,
busca la misma caracteristica.
Asi que este el borde a la izquierda del cuadro
o a la derecha, lo puede captar.
Entonces, en vez de un punto, escaneemos todos.

03

Desliza el filtro para hacer un mapa de caracteristicas

Ahora mueve el filtro paso a paso.
Empieza arriba a la izquierda,
una celda a la derecha, luego otra.
Al llegar al final, baja una fila
y escanea de nuevo desde la izquierda.
Anota la puntuacion en cada punto,
y las puntuaciones forman una rejilla pequena nueva.
Este es el mapa de caracteristicas.
Muestra de un vistazo donde la caracteristica es fuerte.

rejilla de brillo
1
1
8
8
8
2
1
9
8
7
1
2
8
9
8
1
1
7
8
9
2
1
8
8
8
mapa de caracteristicas
0 / 16

Toca para deslizar el filtro paso a paso. La puntuacion de cada punto llena el mapa de la derecha. Al terminar, el mapa revela donde la caracteristica es fuerte.

El filtro barrio toda la rejilla.
Las puntuaciones formaron un mapa de caracteristicas.
Es menor que la foto original,
pero muestra con claridad donde esta la caracteristica.
Un filtro halla solo un tipo de caracteristica.
Por eso en la practica usamos muchos filtros juntos.
Bordes verticales, horizontales, curvas,
hallando distintas caracteristicas a la vez.
Pero estas son aun solo caracteristicas pequenas.

04

Capas mas altas, caracteristicas mayores

Pasa un filtro por el mapa una vez mas
y las caracteristicas pequenas se juntan en mayores.
La capa frontal ve piezas pequenas como puntos y bordes,
la de arriba junta bordes en un ojo o una nariz,
y una mas alta junta ojos y nariz en un rostro entero.
Es igual que apilar capas en una red neuronal.
La diferencia es que aqui cada capa escanea con filtros.
Asi que cuanto mas subes,
mas abstractas las caracteristicas que capta.

capa 1: bordes
capa 2: partes (ojo, nariz)
capa 3: rostro entero
Las capas bajas captan piezas de borde pequenas.
1 / 3

Toca el boton para subir una capa cada vez. De bordes a partes como un ojo y una nariz, luego a un rostro entero, la abstraccion sube paso a paso.

Cada capa arriba, lo que ve crecio.
De bordes a ojos y nariz, luego a un rostro.
Las capas bajas ven piezas pequenas y simples,
y las altas las juntan en formas con sentido.
Es muy parecido a como una persona reconoce cosas.
Ver lineas, reconocer partes, saber el todo.
Escanear con filtros pequenos para hallar caracteristicas
y apilar esas capas para subir la abstraccion
es justo la destreza de una CNN que mira imagenes.

05

Resumamos

Reunido en una linea, es esto.
Una foto es una rejilla llena de numeros de brillo.
Una CNN pone un filtro pequeno, una lupa, en una ventana
y puntua si esa caracteristica esta ahi.
Deslizar el mismo filtro por la rejilla
hace un mapa que la halla este donde este.
Apilando muchas de esas capas,
de bordes a ojos y nariz, luego a un rostro,
capta caracteristicas cada vez mas abstractas. Eso es una CNN.

Toca los puntos clave en orden para repasar

Toca los puntos clave en orden para repasar. (una foto es rejilla de numeros -> un filtro pequeno puntua una caracteristica -> escanea para hacer un mapa -> capas mas altas, mas abstractas)

Ahora sabes como una computadora ve una imagen.
Convierte la foto en una rejilla de numeros,
escaneala con filtros pequenos para hallar caracteristicas,
y apila capas para subir la abstraccion paso a paso.
Un gato corrido lo capta igual el mismo filtro.
Esta idea simple, escanear con lupa y juntar caracteristicas,
es la base de maquinas listas que reconocen imagenes.
Luego sigamos explorando como esta forma de ver
se aplica tambien a texto y sonido.

En una líneaUna CNN es una red neuronal que mira imagenes. Primero, una foto es en realidad una rejilla repleta de numeros de brillo. Brillante es un numero grande, oscuro uno pequeno. Una CNN coloca un filtro pequeno, un panel como una lupa, sobre una ventana de la imagen y puntua si la caracteristica que busca esta ahi. Deslizar el mismo filtro por la rejilla paso a paso construye un mapa de caracteristicas que la halla este donde este en el cuadro. Un cambio de posicion no le molesta, pues el mismo filtro hace la busqueda. Y al apilar muchas de esas capas, la capa frontal capta bordes pequenos, la de arriba junta bordes en un ojo o una nariz, y una mas alta los junta en un rostro entero. Cuanto mas subes, mas abstractas las caracteristicas. En resumen, ve la foto como rejilla de numeros, escanea con filtros pequenos para hallar caracteristicas, y apila esas capas para subir la abstraccion. Eso es una CNN.
IA
¿Te fue útil? Apoyar seegongsik