📘

IA con las manos — el orden del libro

Todos los recursos del libro, en el orden en que aparecen. Si los sigues de principio a fin pasarás del reconocimiento al entrenamiento, de ahí a las redes neuronales y por último a la generación.

Si estás leyendo el libro, guíate por el número de página. Y si no lo tienes, basta con seguir el orden. Los servicios que cerraron ya no aparecen.

1

El primer encuentro

Empezamos por el momento en que la computadora reconoce tu dibujo.

2

La computadora mira a las personas

Rostro, manos, postura, objetos. Con una sola cámara web, hasta dónde llega el reconocimiento.

Face Mesh (malla facial)

MediaPipe ofrece una solución de reconocimiento facial. Estima 468 puntos del rostro y los convierte en una forma 3D ajustada a tu cara.

Pose (postura)

MediaPipe ofrece una solución de reconocimiento de postura. Estima la posición de 33 puntos clave del cuerpo y los une para mostrarlos como un esqueleto.

Hands (manos)

MediaPipe ofrece una solución para seguir manos y dedos. Puede seguir 21 puntos clave en una a cuatro manos.

3

Ahora enseñas tú

Un paso más allá de usar el modelo de otro: entrénalo con tus propias manos.

Teachable MachineEjecutar
Coreano
Teachable Machine

Una herramienta web de aprendizaje automático pensada para que cualquiera cree un modelo de forma rápida y sencilla. Permite hacer modelos de imagen, audio y postura.

Scratch 3 con aprendizaje automático

Una versión de Scratch 3 con una biblioteca de aprendizaje automático incorporada. Sus funciones vienen en forma de bloques, así que se usan igual que los bloques de Scratch de siempre.

4

IA que aprende sola — aprendizaje por refuerzo

Nadie le da la respuesta; solo se la premia cuando lo hace bien. Míra cómo mejora sola frente a un juego.

Auto DQN

Un simulador de conducción autónoma basado en DQN. El auto aprende por sí mismo a conducir usando DQN.

Guerra de aviones (DQN)Ejecutar
Coreano
Guerra de aviones (DQN)

Muestra cómo se aprende a esquivar aviones enemigos usando DQN. El agente recibe información de sus sensores y gana más recompensa cuanto más tiempo sobrevive.

Snake (DQN)Ejecutar
Coreano
Snake (DQN)

Permite ver cómo se aprende el juego de la serpiente con DQN. El aprendizaje por refuerzo la penaliza si choca contra la pared o contra su propio cuerpo, y la premia si come fruta.

Flappy Bird con aprendizaje automático

Permite ver cómo se aprende Flappy Bird con redes neuronales y un algoritmo genético. Los pájaros vuelan mejor generación tras generación, apoyándose en lo aprendido por la anterior.

2048 con IAEjecutar
Coreano
2048 con IA

Permite ver cómo se aprende a jugar 2048 con el algoritmo MCTS. Si le das muchas simulaciones por jugada, llega a 2048 con alta probabilidad.

5

CNN — cómo se reconoce una imagen

Ya viste que funciona; ahora ábrelo. Recursos donde se ve qué queda al pasar por cada capa.

Reconocimiento de dibujos

Un juego que aprende del conjunto de dibujos a mano de Quick, Draw! y adivina qué dibujaste. Aprende y reconoce los trazos con una CNN.

Tetris con IA

Una IA que aprende a jugar Tetris con una CNN. Se la entrenó una y otra vez para colocar las piezas de forma parecida a como lo hacen los campeones.

AutoDraw

Una aplicación de dibujo que adivina qué estás dibujando y te propone íconos parecidos para que elijas uno.

Quick, Draw!Ejecutar
Coreano
Quick, Draw!

Un juego en el que dibujas lo que te piden y una IA entrenada trata de adivinar qué es.

6

RNN — la red que recuerda el orden

Cosas que exigen recordar lo anterior: melodía, escritura, movimiento. La música es donde mejor se oye.

Caja de ritmos neuronalEjecutar
Coreano
Caja de ritmos neuronal

Una aplicación de composición de batería hecha con un modelo Drums RNN ya entrenado. Le das un patrón inicial y va generando los siguientes a partir de él.

RNN que compone al pianoEjecutar
Coreano
RNN que compone al piano

Compone piezas con el modelo Performance RNN, teniendo en cuenta con qué frecuencia se usa cada nota. El modelo aprendió estructuras y patrones musicales con LSTM.

Dibujo autocompletado (Magenta)Ejecutar
Coreano
Dibujo autocompletado (Magenta)

Una aplicación de dibujo continuado hecha con una RNN. Aprendió del conjunto de datos de Quick, Draw!, así que cuando empiezas un trazo lo continúa como si lo dibujara una mano.

Crear bucles de melodíaEjecutar
Coreano
Crear bucles de melodía

Una aplicación que genera melodías repetidas con el modelo MusicVAE. MusicVAE enlaza varias melodías con suavidad para armar una que suene armónica.

Componer patrones de arpegioEjecutar
Coreano
Componer patrones de arpegio

Hecho con Magenta e Improv RNN para tocar patrones de arpegio. Improv RNN genera la melodía condicionada por la progresión de acordes de base.

7

GAN — crear lo que no existe

Dos redes compiten y de ahí sale algo que parece real. La generación anterior de la IA generativa.

Explicación visual de las GANEjecutar
Coreano
Explicación visual de las GAN

Un programa para seguir en tiempo real el entrenamiento de una GAN con una herramienta de visualización interactiva. Usa como ejemplo el trabajo del generador y el discriminador sobre datos en 2D.

Crear personajes de mangaEjecutar
Coreano
Crear personajes de manga

Un modelo GAN que genera rostros según los atributos que elijas. Cambiando el modelo y los atributos puedes armar el personaje que quieras.

De boceto a fotoEjecutar
Coreano
De boceto a foto

Un servicio que toma una imagen de origen, por ejemplo un boceto, y la convierte en otra usando el modelo GAN Pix2Pix.

8

Conducción autónoma

El punto donde el reconocimiento y el aprendizaje por refuerzo se encuentran en un problema real. Al final hay una pregunta sin respuesta.

9

IA generativa

Lo que más ha cambiado desde que salió el libro. Aquí está actualizado con los servicios que se usan hoy.

Wrtn (portal de IA)Ejecutar
Coreano
Wrtn (portal de IA)

Un portal de IA coreano donde puedes elegir y usar gratis, en un mismo lugar, modelos recientes y conocidos de todo el mundo como GPT-5, Claude 3.5 y SD3.

ChatGPT (OpenAI)Ejecutar
Coreano
ChatGPT (OpenAI)

La IA conversacional más conocida de OpenAI. Con el modelo GPT-5 más reciente conversa por texto y por voz, y además es multimodal: mira imágenes para analizarlas y también dibuja.

Copilot (Microsoft)Ejecutar
Coreano
Copilot (Microsoft)

El asistente de IA de Microsoft (antes Bing Chat), basado en GPT-5. Al estar unido al buscador Bing responde con información actualizada, y dibuja con DALL·E 3.

Gemini (Google)Ejecutar
Coreano
Gemini (Google)

Gemini (antes Bard) es el modelo multimodal más reciente de Google. Entiende y procesa texto, código e imágenes, y al conectarse con los servicios de Google ofrece información variada y precisa.