🔬

Mirar por dentro — cómo funciona la IA de verdad

«Ya viste que funciona; ahora ábrelo.» Herramientas visuales para ver qué aprende una red neuronal y cómo decide, haciendo clic en lugar de leer fórmulas.

Casi no aparecen fórmulas. Cambiar un valor y mirar qué pasa se te queda mucho más que leerlo.

1

Cómo aprende una red neuronal

Empieza por separar unos cuantos puntos. Toca tú mismo qué cambia al añadir neuronas y capas.

TensorFlow Playground

Una página de práctica para entrenar tú mismo una red neuronal pequeña dentro del navegador. Al cambiar el número de capas y de neuronas, la función de activación o la tasa de aprendizaje, ves cómo cambia la frontera que separa los datos. No descarga ningún modelo, así que funciona en cuanto la abres.

wevi (observar cómo se entrenan los embeddings)

Una herramienta para seguir paso a paso cómo word2vec va construyendo los vectores de palabras. Le das datos de entrenamiento muy pequeños, como "eat|apple, drink|milk", y al avanzar el entrenamiento cambian poco a poco los colores de las matrices de pesos de entrada y salida mientras los puntos de las palabras van encontrando su lugar en el gráfico PCA de abajo. Se entiende que un embedding no es un valor fijado de antemano, sino algo que se va formando a base de repetir el entrenamiento.

Embedding Projector (explorar el espacio de embeddings)

Una herramienta de TensorFlow que reduce a dos o tres dimensiones los embeddings —datos como palabras representados en vectores de cientos de dimensiones— para poder verlos. Al abrirla aparecen como puntos 10.000 palabras de Word2Vec en 200 dimensiones, y al elegir una se listan sus palabras vecinas más cercanas. Comprueban con los ojos la propiedad básica de los embeddings: las palabras de significado parecido se agrupan cerca en el espacio.

2

El ojo que ve imágenes (CNN)

En qué se convierte una imagen al pasar por las capas, y qué atrapa cada filtro.

Visualización 3D de una CNN (reconocer dígitos escritos a mano)

Una visualización que despliega en tres dimensiones el interior de una red convolucional (CNN) que adivina dígitos escritos a mano. Se ve cómo la imagen se va resumiendo en valores cada vez más pequeños y abstractos al pasar de la capa de entrada a las convolucionales, las de submuestreo, las totalmente conectadas y la de salida. Queda claro que una red neuronal no es una caja negra maciza, sino capas con papeles distintos puestas una tras otra.

3

Por dentro de un modelo de lenguaje

El texto se parte en tokens, las palabras se miran entre sí (atención) y sale la siguiente palabra. Paso a paso.

Tokenizer Playground

Una página que muestra con colores en qué fragmentos (tokens) se parte la frase que escribas dentro de un modelo de IA. Puedes elegir y comparar los tokenizadores de trece modelos: GPT-4, Claude, Llama 3, Gemma, Mistral, BERT, T5 y otros.

Tiktokenizer (ver cómo se parte el texto en tokens)

Una herramienta para ver con qué unidades (tokens) parte un modelo de lenguaje una frase. Al escribir un texto aparecen al momento el número de tokens, los fragmentos separados por colores y el número identificador de cada uno. También puedes ver con qué marcas especiales llega realmente al modelo una conversación.

Transformer Explainer (cómo funciona un transformador)

Una visualización didáctica que muestra paso a paso cómo un modelo de lenguaje tipo GPT elige la palabra siguiente. Ejecuta GPT-2 (small) de verdad en el navegador, así que puedes seguir cómo tu frase se vuelve tokens y embeddings, pasa por la autoatención y el MLP y termina en las probabilidades de la palabra siguiente. Se entiende que un modelo de lenguaje no es magia, sino un aparato que calcula qué palabra es más probable a continuación.

Attention Viz (mapa global de la atención en un transformador)

Una herramienta de visualización que pone en una sola pantalla, capa por capa y cabeza por cabeza, los patrones de atención de un modelo transformador para compararlos. Como proyecta en el mismo espacio los vectores de consulta y de clave, se ve de un vistazo que cada cabeza forma un patrón con una forma completamente distinta. Se comprueba que las cabezas de atención miran relaciones diferentes entre sí; está pensada para quien ya conoce la arquitectura del transformador.

LLM Visualization (anatomía 3D de un modelo de lenguaje)

Un recorrido que despliega el interior de un modelo de lenguaje GPT como una figura tridimensional y baja por él de arriba abajo. Empieza con nano-gpt, un modelo de apenas 85.000 parámetros, y muestra cómo resuelve una tarea muy simple: ordenar alfabéticamente una cadena como "C B A B B C". Te deja una idea clara de qué cálculo ocurre en cada capa, desde que los números se vuelven embeddings hasta que salen las probabilidades del token siguiente.

4

Cómo se crea lo que no existe

La GAN, donde dos redes compiten, y la difusión, que va sacando una imagen del ruido. Los dos pilares de la IA generativa.

Explicación visual de las GANEjecutar
Coreano
Explicación visual de las GAN

Un programa para seguir en tiempo real el entrenamiento de una GAN con una herramienta de visualización interactiva. Usa como ejemplo el trabajo del generador y el discriminador sobre datos en 2D.

Diffusion Explainer (cómo se genera una imagen)

Una visualización que muestra paso a paso cómo Stable Diffusion convierte un texto en una imagen. En una sola pantalla puedes seguir cómo la frase se parte en tokens, se convierte en vectores, se va quitando el ruido aleatorio poco a poco hasta afinar la imagen y por último se aumenta la resolución.