Una aplicación que aprende con una CNN los dibujos a mano de Quick, Draw! y luego los reconoce. Distingue 100 dibujos distintos.
IA con las manos — el orden del libro
Todos los recursos del libro, en el orden en que aparecen. Si los sigues de principio a fin pasarás del reconocimiento al entrenamiento, de ahí a las redes neuronales y por último a la generación.
Si estás leyendo el libro, guíate por el número de página. Y si no lo tienes, basta con seguir el orden. Los servicios que cerraron ya no aparecen.
El primer encuentro
Empezamos por el momento en que la computadora reconoce tu dibujo.
La computadora mira a las personas
Rostro, manos, postura, objetos. Con una sola cámara web, hasta dónde llega el reconocimiento.
La solución de detección de rostros de MediaPipe detecta rápido si hay una cara y marca seis puntos clave. Es sencilla, así que va muy rápido.
MediaPipe ofrece una solución de reconocimiento facial. Estima 468 puntos del rostro y los convierte en una forma 3D ajustada a tu cara.
MediaPipe ofrece una solución de reconocimiento de postura. Estima la posición de 33 puntos clave del cuerpo y los une para mostrarlos como un esqueleto.
MediaPipe ofrece una solución para seguir manos y dedos. Puede seguir 21 puntos clave en una a cuatro manos.
Reúne en una sola solución las funciones de manos, malla facial y postura de MediaPipe.
Permite crear animación de personajes con MediaPipe y TensorFlow. Reconoce el rostro o el cuerpo entero y hace que el personaje repita los movimientos.
Reconoce el rostro con FaceMesh de MediaPipe y a partir de ahí arma un avatar virtual.
Una aplicación de reconocimiento facial hecha con TensorFlow. A partir del rostro detectado estima cosas como la expresión y la edad.
Esta aplicación reconoce en 3D objetos que ves todos los días. Para los objetos con los que fue entrenada, estima su posición en tiempo real y te la muestra.
Un juego para quitar la escarcha que se forma sobre el video de la cámara. Está hecho con un modelo de reconocimiento de manos.
Un juego para encontrar a tu alrededor el objeto que muestra el emoji. Predice la imagen con una CNN y comprueba si coincide con el emoji.
Reconoce en tiempo real la postura y el rostro de la persona en el video y los convierte en la animación de un personaje.
Ahora enseñas tú
Un paso más allá de usar el modelo de otro: entrénalo con tus propias manos.
Una herramienta web de aprendizaje automático pensada para que cualquiera cree un modelo de forma rápida y sencilla. Permite hacer modelos de imagen, audio y postura.
Una versión de Scratch 3 con una biblioteca de aprendizaje automático incorporada. Sus funciones vienen en forma de bloques, así que se usan igual que los bloques de Scratch de siempre.
Permite jugar 2048 con reconocimiento de imágenes mediante una CNN.
Un Pac-Man que se maneja con reconocimiento de imágenes. Usa un modelo MobileNet ya entrenado para reconocer los movimientos de las cuatro direcciones.
IA que aprende sola — aprendizaje por refuerzo
Nadie le da la respuesta; solo se la premia cuando lo hace bien. Míra cómo mejora sola frente a un juego.
Un simulador de conducción autónoma basado en DQN. El auto aprende por sí mismo a conducir usando DQN.
Muestra cómo se aprende a esquivar bolas usando DQN. El agente recibe información de sus sensores y gana más recompensa cuanto más tiempo sobrevive.
Muestra cómo se aprende a esquivar aviones enemigos usando DQN. El agente recibe información de sus sensores y gana más recompensa cuanto más tiempo sobrevive.
Permite ver cómo se aprende el juego de la serpiente con DQN. El aprendizaje por refuerzo la penaliza si choca contra la pared o contra su propio cuerpo, y la premia si come fruta.
Permite ver cómo se aprende Flappy Bird con redes neuronales y un algoritmo genético. Los pájaros vuelan mejor generación tras generación, apoyándose en lo aprendido por la anterior.
Se le enseñó a jugar al juego de los gorilas con un algoritmo de aprendizaje supervisado, usando una red neuronal sencilla hecha con TensorFlow.
Permite ver cómo se aprende a jugar 2048 con el algoritmo MCTS. Si le das muchas simulaciones por jugada, llega a 2048 con alta probabilidad.
CNN — cómo se reconoce una imagen
Ya viste que funciona; ahora ábrelo. Recursos donde se ve qué queda al pasar por cada capa.
Keras es una biblioteca de aprendizaje profundo que facilita implementar IA rápido. En la demo puedes ver en el navegador cómo entrena Keras y qué rendimiento da.
ConvNetJS es una biblioteca para entrenar modelos de aprendizaje profundo en el navegador. Las demos visualizan cómo avanza el entrenamiento y qué resultado da.
Un juego que aprende del conjunto de dibujos a mano de Quick, Draw! y adivina qué dibujaste. Aprende y reconoce los trazos con una CNN.
Una IA que aprende a jugar Tetris con una CNN. Se la entrenó una y otra vez para colocar las piezas de forma parecida a como lo hacen los campeones.
Un programa hecho para entender con facilidad cómo funciona una CNN por dentro. Visualiza paso a paso el reconocimiento de una imagen.
Carga modelos de aprendizaje profundo ya entrenados con TensorFlow y los dibuja como una escena 3D. Así puedes ver cómo procesa cada modelo.
Una aplicación de dibujo que adivina qué estás dibujando y te propone íconos parecidos para que elijas uno.
Un juego en el que dibujas lo que te piden y una IA entrenada trata de adivinar qué es.
RNN — la red que recuerda el orden
Cosas que exigen recordar lo anterior: melodía, escritura, movimiento. La música es donde mejor se oye.
Una aplicación de composición de batería hecha con un modelo Drums RNN ya entrenado. Le das un patrón inicial y va generando los siguientes a partir de él.
Compone piezas con el modelo Performance RNN, teniendo en cuenta con qué frecuencia se usa cada nota. El modelo aprendió estructuras y patrones musicales con LSTM.
Con LSTM memoriza los trazos (stroke) de las letras que escribes y, a partir de ahí, muestra las letras que predice.
Una aplicación de dibujo continuado hecha con una RNN. Aprendió del conjunto de datos de Quick, Draw!, así que cuando empiezas un trazo lo continúa como si lo dibujara una mano.
Una aplicación que genera melodías repetidas con el modelo MusicVAE. MusicVAE enlaza varias melodías con suavidad para armar una que suene armónica.
Hecho con Magenta e Improv RNN para tocar patrones de arpegio. Improv RNN genera la melodía condicionada por la progresión de acordes de base.
Un juego en el que manejas al personaje con reconocimiento de movimiento, usando TensorFlow y la cámara. El personaje ataca al rival copiando lo que haces.
GAN — crear lo que no existe
Dos redes compiten y de ahí sale algo que parece real. La generación anterior de la IA generativa.
Un programa para seguir en tiempo real el entrenamiento de una GAN con una herramienta de visualización interactiva. Usa como ejemplo el trabajo del generador y el discriminador sobre datos en 2D.
Un modelo GAN que genera rostros según los atributos que elijas. Cambiando el modelo y los atributos puedes armar el personaje que quieras.
Un servicio que toma una imagen de origen, por ejemplo un boceto, y la convierte en otra usando el modelo GAN Pix2Pix.
Un servicio que convierte fotos de paisajes en imágenes de estilo animación con el modelo AnimeGAN.
Conducción autónoma
El punto donde el reconocimiento y el aprendizaje por refuerzo se encuentran en un problema real. Al final hay una pregunta sin respuesta.
Una demo que visualiza los conjuntos de datos KITTI y NuScenes con streetscape.gl, una herramienta para representar datos de conducción autónoma.
Un simulador de conducción autónoma hecho con WebGL y Three.js. Está diseñado para esquivar obstáculos fijos y en movimiento y llegar al destino.
Permite entrenar un auto autónomo aplicando varios algoritmos de aprendizaje por refuerzo. Puedes ver el proceso de cada uno y su resultado.
Una aplicación que plantea, en forma de juego, los dilemas éticos que pueden surgir durante la conducción autónoma. No hay una respuesta correcta, y también puedes ver qué eligieron otras personas.
IA generativa
Lo que más ha cambiado desde que salió el libro. Aquí está actualizado con los servicios que se usan hoy.
Un portal de IA coreano donde puedes elegir y usar gratis, en un mismo lugar, modelos recientes y conocidos de todo el mundo como GPT-5, Claude 3.5 y SD3.
La IA conversacional más conocida de OpenAI. Con el modelo GPT-5 más reciente conversa por texto y por voz, y además es multimodal: mira imágenes para analizarlas y también dibuja.
El asistente de IA de Microsoft (antes Bing Chat), basado en GPT-5. Al estar unido al buscador Bing responde con información actualizada, y dibuja con DALL·E 3.
Gemini (antes Bard) es el modelo multimodal más reciente de Google. Entiende y procesa texto, código e imágenes, y al conectarse con los servicios de Google ofrece información variada y precisa.
Una herramienta de generación de imágenes gratuita y sin cuenta. Fue famosa con el nombre de DALL·E mini y va bien para hacer imágenes sin complicarse.
La herramienta de generación de imágenes de Microsoft (antes Bing Image Creator), con DALL·E 3. Convierte en imágenes de buena calidad la frase que escribas.




















































