Una versión de Scratch 3 con una biblioteca de aprendizaje automático incorporada. Sus funciones vienen en forma de bloques, así que se usan igual que los bloques de Scratch de siempre.
AI Teading - Experimentos y lecciones de IA para probar
Un laboratorio de IA que corre en tu navegador, sin instalar nada. Prueba 137 experimentos de imagen, música, lenguaje y conducción autónoma, y descubre cómo funcionan.
Un simulador de conducción autónoma basado en DQN. El auto aprende por sí mismo a conducir usando DQN.
Un juego para quitar la escarcha que se forma sobre el video de la cámara. Está hecho con un modelo de reconocimiento de manos.
Esta aplicación reconoce en 3D objetos que ves todos los días. Para los objetos con los que fue entrenada, estima su posición en tiempo real y te la muestra.
MediaPipe ofrece una solución para seguir manos y dedos. Puede seguir 21 puntos clave en una a cuatro manos.
MediaPipe ofrece una solución de reconocimiento facial. Estima 468 puntos del rostro y los convierte en una forma 3D ajustada a tu cara.
MediaPipe ofrece una solución de reconocimiento de postura. Estima la posición de 33 puntos clave del cuerpo y los une para mostrarlos como un esqueleto.
Reúne en una sola solución las funciones de manos, malla facial y postura de MediaPipe.
La solución de detección de rostros de MediaPipe detecta rápido si hay una cara y marca seis puntos clave. Es sencilla, así que va muy rápido.
Una solución de MediaPipe que quita a la persona o el fondo en video en tiempo real. Sirve, por ejemplo, para componer imágenes.
Una aplicación de reconocimiento facial hecha con TensorFlow. A partir del rostro detectado estima cosas como la expresión y la edad.
Usa TensorFlow para quitar en tiempo real a las personas del fondo. Reconoce a la persona y aprende el fondo para borrarla de la escena.
Reconoce el rostro y la postura en una foto fija y con eso arma la animación de un personaje.
Reconoce en tiempo real la postura y el rostro de la persona en el video y los convierte en la animación de un personaje.
Permite crear animación de personajes con MediaPipe y TensorFlow. Reconoce el rostro o el cuerpo entero y hace que el personaje repita los movimientos.
Un juego que aprende del conjunto de dibujos a mano de Quick, Draw! y adivina qué dibujaste. Aprende y reconoce los trazos con una CNN.
Una aplicación que aprende con una CNN los dibujos a mano de Quick, Draw! y luego los reconoce. Distingue 100 dibujos distintos.
Un juego en el que dibujas lo que te piden y una IA entrenada trata de adivinar qué es.
Una aplicación de dibujo que adivina qué estás dibujando y te propone íconos parecidos para que elijas uno.
Una aplicación de dibujo continuado hecha con una RNN. Aprendió del conjunto de datos de Quick, Draw!, así que cuando empiezas un trazo lo continúa como si lo dibujara una mano.
Muestra cómo se aprende a esquivar bolas usando DQN. El agente recibe información de sus sensores y gana más recompensa cuanto más tiempo sobrevive.
Muestra cómo se aprende a esquivar aviones enemigos usando DQN. El agente recibe información de sus sensores y gana más recompensa cuanto más tiempo sobrevive.
Muestra cómo se lleva a cabo el aprendizaje por refuerzo con TensorFlow. El objetivo es mantener el poste en equilibrio el mayor tiempo posible.
Permite ver cómo se aprende el juego de la serpiente con DQN. El aprendizaje por refuerzo la penaliza si choca contra la pared o contra su propio cuerpo, y la premia si come fruta.
Permite ver cómo se aprende a jugar 2048 con el algoritmo MCTS. Si le das muchas simulaciones por jugada, llega a 2048 con alta probabilidad.
Se le enseñó a jugar al juego de los gorilas con un algoritmo de aprendizaje supervisado, usando una red neuronal sencilla hecha con TensorFlow.
Permite ver cómo se aprende Flappy Bird con redes neuronales y un algoritmo genético. Los pájaros vuelan mejor generación tras generación, apoyándose en lo aprendido por la anterior.
Una IA que aprende a jugar Tetris con una CNN. Se la entrenó una y otra vez para colocar las piezas de forma parecida a como lo hacen los campeones.
Un juego para encontrar a tu alrededor el objeto que muestra el emoji. Predice la imagen con una CNN y comprueba si coincide con el emoji.
Una herramienta web de aprendizaje automático pensada para que cualquiera cree un modelo de forma rápida y sencilla. Permite hacer modelos de imagen, audio y postura.
Compone piezas con el modelo Performance RNN, teniendo en cuenta con qué frecuencia se usa cada nota. El modelo aprendió estructuras y patrones musicales con LSTM.
Una aplicación que genera melodías repetidas con el modelo MusicVAE. MusicVAE enlaza varias melodías con suavidad para armar una que suene armónica.
Hecho con Magenta e Improv RNN para tocar patrones de arpegio. Improv RNN genera la melodía condicionada por la progresión de acordes de base.
Una aplicación de composición de batería hecha con un modelo Drums RNN ya entrenado. Le das un patrón inicial y va generando los siguientes a partir de él.
Un juego en el que manejas al personaje con reconocimiento de movimiento, usando TensorFlow y la cámara. El personaje ataca al rival copiando lo que haces.
Un Pac-Man que se maneja con reconocimiento de imágenes. Usa un modelo MobileNet ya entrenado para reconocer los movimientos de las cuatro direcciones.
Keras es una biblioteca de aprendizaje profundo que facilita implementar IA rápido. En la demo puedes ver en el navegador cómo entrena Keras y qué rendimiento da.
ConvNetJS es una biblioteca para entrenar modelos de aprendizaje profundo en el navegador. Las demos visualizan cómo avanza el entrenamiento y qué resultado da.
Permite recorrer paso a paso, con TensorFlow, cómo se entrena el reconocimiento de imágenes de piedra, papel o tijera.
Carga modelos de aprendizaje profundo ya entrenados con TensorFlow y los dibuja como una escena 3D. Así puedes ver cómo procesa cada modelo.
Un programa donde el dinosaurio aprende a esquivar obstáculos mediante varios tipos de entrenamiento, sobre TensorFlow.
Un programa hecho para entender con facilidad cómo funciona una CNN por dentro. Visualiza paso a paso el reconocimiento de una imagen.
Un programa para seguir en tiempo real el entrenamiento de una GAN con una herramienta de visualización interactiva. Usa como ejemplo el trabajo del generador y el discriminador sobre datos en 2D.
Un servicio que convierte fotos de paisajes en imágenes de estilo animación con el modelo AnimeGAN.
Una aplicación entrenada con muchos ejemplos MIDI que toca la continuación de lo que tocas tú. Toca unas notas y responde con lo que viene después.
Con LSTM memoriza los trazos (stroke) de las letras que escribes y, a partir de ahí, muestra las letras que predice.
Reconoce el rostro con FaceMesh de MediaPipe y a partir de ahí arma un avatar virtual.
Un modelo GAN que genera rostros según los atributos que elijas. Cambiando el modelo y los atributos puedes armar el personaje que quieras.
Permite jugar 2048 con reconocimiento de imágenes mediante una CNN.
Un servicio que toma una imagen de origen, por ejemplo un boceto, y la convierte en otra usando el modelo GAN Pix2Pix.
Un simulador de conducción autónoma hecho con WebGL y Three.js. Está diseñado para esquivar obstáculos fijos y en movimiento y llegar al destino.
Una demo que visualiza los conjuntos de datos KITTI y NuScenes con streetscape.gl, una herramienta para representar datos de conducción autónoma.
Una aplicación que muestra cómo trabaja un algoritmo genético a través del aprendizaje del estacionamiento. Con el algoritmo genético, el auto se entrena para estacionarse por su cuenta.
Una aplicación que plantea, en forma de juego, los dilemas éticos que pueden surgir durante la conducción autónoma. No hay una respuesta correcta, y también puedes ver qué eligieron otras personas.
Permite entrenar un auto autónomo aplicando varios algoritmos de aprendizaje por refuerzo. Puedes ver el proceso de cada uno y su resultado.
La IA conversacional más conocida de OpenAI. Con el modelo GPT-5 más reciente conversa por texto y por voz, y además es multimodal: mira imágenes para analizarlas y también dibuja.
Una herramienta de generación de imágenes gratuita y sin cuenta. Fue famosa con el nombre de DALL·E mini y va bien para hacer imágenes sin complicarse.
Gemini (antes Bard) es el modelo multimodal más reciente de Google. Entiende y procesa texto, código e imágenes, y al conectarse con los servicios de Google ofrece información variada y precisa.
El asistente de IA de Microsoft (antes Bing Chat), basado en GPT-5. Al estar unido al buscador Bing responde con información actualizada, y dibuja con DALL·E 3.
La herramienta de generación de imágenes de Microsoft (antes Bing Image Creator), con DALL·E 3. Convierte en imágenes de buena calidad la frase que escribas.
Elige un Pokémon y conversa con él a través de un modelo de IA. Una experiencia divertida y a la vez educativa.
Un portal de IA coreano donde puedes elegir y usar gratis, en un mismo lugar, modelos recientes y conocidos de todo el mundo como GPT-5, Claude 3.5 y SD3.
La IA de generación de imágenes de Adobe. Se entrenó con datos relativamente libres de problemas de derechos de autor, y en la web puedes probar gratis funciones como texto a imagen y relleno generativo.
La IA de generación musical más popular ahora mismo: le das un prompt de texto y devuelve una canción de buena calidad, con letra, voz y acompañamiento.
Un competidor fuerte de ChatGPT: escribe muy bien y destaca por entender contextos largos.
Un servicio para conversar con IA que adoptan personajes muy distintos: personas reales, personajes de animación, protagonistas de videojuegos. Da la sensación de estar hablando con el personaje de verdad.
Una ópera cantada por cuatro blobs entrenados con aprendizaje automático. Ajusta con el mouse la altura y la vocal y cantan armonizando en tiempo real.
Un proyecto publicado por el laboratorio de IA de Meta: subes el dibujo de un personaje y lo convierte en una animación que baila y corre.
De las dos fotos, una es de una persona real y la otra es un rostro falso generado por IA. Un juego para poner a prueba tu capacidad de distinguir imágenes hechas por IA.
Un juego de asociación de palabras hecho por Google. Jugando puedes comprobar hasta qué punto la IA entiende el significado y el contexto de las palabras.
Toca junto a un pájaro con IA entrenado con grabaciones de chelo y violín. Según muevas el mouse, la IA genera en tiempo real el movimiento del arco y la afinación.
Dibujas en el lienzo y suena música según la posición y el instrumento. Un experimento de IA sinestésico para vivir cómo se convierte lo visual en sonido.
Una IA de captura de movimiento que reconoce cómo te mueves a través de la cámara y hace que el garabato que dibujaste repita esos movimientos.
La IA analiza cuánto se parece tu voz a la de Freddie Mercury, de la legendaria banda Queen. Analiza la afinación (Pitch), el timbre (Timbre) y la melodía para darte un puntaje.
La IA mira una imagen, imagina qué sonido le corresponde y te lo hace escuchar. Con Google Street View puedes recorrer el mundo y oír el sonido imaginado de cada lugar.
Un experimento de Google Magenta que convierte lo que cantas o golpeas en el sonido de una flauta, un saxofón, una trompeta o un violín. Cada modelo se entrenó con diez minutos de grabación de un intérprete real, así que vuelven también su respiración y el roce del arco.
El primer doodle con inteligencia artificial de Google, publicado en 2019 por el cumpleaños de Bach. Un modelo de aprendizaje automático le pone armonías al estilo de Bach a la melodía de dos compases que escribas. Usa el modelo Coconet, entrenado con 306 corales armonizados por Bach.
Un experimento de Google Creative Lab que reúne miles de sonidos grabados de la vida diaria, agrupados por parecido como en un mapa, para armar con ellos un ritmo de batería. El material no son instrumentos, sino sonidos de todos los días.
Una herramienta web que sube una canción y separa la voz del acompañamiento con inteligencia artificial. Puedes descargar por separado la pista sin voz, para karaoke, y la pista con solo la voz, a capela. Según el sitio, el proceso suele tardar unos diez segundos.
Un experimento de Google Arts & Culture donde el aprendizaje automático le pone armonías al estilo de Bach a la melodía que marques. La pieza terminada se puede volver a escuchar cambiando el instrumento y el tempo, o compartir con un enlace.
Una herramienta gratuita que lee en voz humana el texto que escribas y lo guarda como archivo de audio. Puedes elegir entre varios idiomas y muchas voces, y según el sitio el audio generado se puede usar incluso con fines comerciales.
Un experimento de Magenta para armar lo-fi hip hop haciendo clic en los objetos de un cuartito dentro del navegador. La televisión del centro está conectada a MusicVAE, que mezcla melodías, y la radio de al lado a MelodyRNN, que crea melodías nuevas, así que la música cambia en vivo con cada clic.
Un experimento que pone un patrón de batería distinto en cada esquina y genera ritmos nuevos a medida que te mueves por el espacio intermedio. Sirve para escuchar qué ritmos pueden existir entre dos ritmos dados.
La página de demostración de Google sobre cómo funciona el reconocimiento de voz que traen los navegadores. Hablas y el texto se transcribe al instante, y puedes elegir el idioma de reconocimiento entre varios, incluido el coreano.
Una visualización que muestra paso a paso cómo Stable Diffusion convierte un texto en una imagen. En una sola pantalla puedes seguir cómo la frase se parte en tokens, se convierte en vectores, se va quitando el ruido aleatorio poco a poco hasta afinar la imagen y por último se aumenta la resolución.
Una herramienta que pinta sobre lo que quieres quitar de una foto y deja que la IA rellene ese hueco de forma que se una con lo que hay alrededor. Sirve para borrar personas, texto, logotipos o la marca de fecha.
Una herramienta que sube la resolución de imágenes en 2D con una red neuronal convolucional (CNN). Sirve tanto para ilustraciones como para fotos, y al ampliar reduce el ruido que deja la compresión JPEG. Puedes comparar tú mismo cuánto disminuyen los bordes dentados al agrandar una imagen pequeña.
Un experimento del Google Arts & Culture Lab hecho con el artista Zach Lieberman. Miras una imagen creada por IA y la describes con palabras; esa descripción se convierte en el prompt que genera una imagen nueva. Lo parecida que salga a la original te dice qué tan precisa fue tu descripción.
Una herramienta de IA que pone color a las fotos en blanco y negro. Puedes elegir entre más de 21 filtros de color o ajustar el color tú mismo escribiendo palabras clave. Sirve para ver cómo se verían con color las fotos viejas de familia o las históricas.
Una herramienta que deja solo a la persona o el objeto y borra el fondo. Al subir la imagen encuentra sola el borde entre el sujeto y el fondo y lo recorta. Sirve para ver hasta dónde llega la IA en bordes complicados, como el pelo.
Una herramienta que pinta sobre lo que quieres quitar de una foto y rellena ese hueco con el fondo de alrededor de forma natural. El modelo corre dentro del navegador, así que la foto no se envía a ningún servidor. Puedes ver cómo se imagina la IA lo que había detrás.
Un espacio para probar en la web el modelo SAM 3 de Meta. Escribes con palabras qué quieres encontrar en una imagen o un video y recorta como región todos los objetos de ese tipo que haya en pantalla. A las regiones recortadas puedes aplicarles efectos como desenfoque, duplicado o contorno con un solo clic.
Una visualización didáctica que muestra paso a paso cómo un modelo de lenguaje tipo GPT elige la palabra siguiente. Ejecuta GPT-2 (small) de verdad en el navegador, así que puedes seguir cómo tu frase se vuelve tokens y embeddings, pasa por la autoatención y el MLP y termina en las probabilidades de la palabra siguiente. Se entiende que un modelo de lenguaje no es magia, sino un aparato que calcula qué palabra es más probable a continuación.
Un recorrido que despliega el interior de un modelo de lenguaje GPT como una figura tridimensional y baja por él de arriba abajo. Empieza con nano-gpt, un modelo de apenas 85.000 parámetros, y muestra cómo resuelve una tarea muy simple: ordenar alfabéticamente una cadena como "C B A B B C". Te deja una idea clara de qué cálculo ocurre en cada capa, desde que los números se vuelven embeddings hasta que salen las probabilidades del token siguiente.
Un juego de palabras en coreano donde hay que adivinar la palabra del día. Al escribir una palabra te dice, con un puntaje de -100 a +100, qué tan cerca está su significado del de la respuesta, y si entra entre las mil primeras también te da su posición. Jugando se siente qué son los embeddings de palabras, que comparan por significado y no por ortografía.
Un juego que arranca con agua, fuego, viento y tierra y va combinando elementos de dos en dos para crear palabras nuevas. Al superponer dos, la IA inventa una palabra y un emoji que encajen con esa combinación. Todo lo que creas se acumula en la lista Discoveries para ver hasta dónde llegaste.
Un juego en el que hablas con un chatbot llamado Gandalf para sacarle una contraseña escondida. Cada vez que pasas un nivel, sus defensas se refuerzan, así que el truco anterior ya no funciona. Viviendo en carne propia con qué se deja engañar una IA y cómo se protege, aprendes las nociones básicas de la seguridad en IA.
Un sitio para comparar cómo responden varios modelos de IA a la misma pregunta. En "Battle Mode", arriba, envías un prompt y recibes las respuestas de varios modelos para ponerlas una al lado de la otra; el sitio publica además una tabla de clasificación. En pantalla el sitio aparece con el nombre "Arena".
Un servicio coreano en el que una IA corrige la ortografía, los espacios y la gramática de un texto en coreano. Lo hizo Baikal AI y, además del corrector, el mismo sitio ofrece análisis morfológico y segmentación de palabras (tokenizador). Los nombres propios y los términos técnicos se pueden registrar en un diccionario propio para que los tenga en cuenta.
Un servicio coreano que resume lo esencial de un video de YouTube, un PDF, una página web o un audio. Además de resumir, explica el contenido de forma más sencilla y te deja seguir preguntando sobre el material. En los videos muestra la transcripción con marcas de tiempo junto a su traducción al coreano.
Un servicio para subir un PDF y preguntar sobre su contenido. Las respuestas llevan citas, así que puedes ver enseguida en qué parte del PDF se apoyan. Además de PDF admite archivos de Word, PowerPoint, Markdown y texto.
El servicio de traducción de Naver, centrado en el coreano y con inglés, japonés, chino y otros idiomas. Además de la traducción de texto tiene pestañas propias para imágenes, documentos, voz y sitios web, así que eliges según el caso. El resultado viene con pronunciación en audio y con una función para valorar la traducción.
Un lugar para conversar directamente con los modelos Olmo publicados por el Allen Institute for AI (Ai2). La pantalla muestra el nombre del modelo en uso; en el momento de la captura era Olmo 3.1 32B Instruct. También puedes activar la llamada a herramientas (tool calling) y añadir las tuyas.
Un servicio de traducción centrado en que los textos largos suenen naturales, que según indica admite más de 100 idiomas. Además de traducir texto tiene modos para archivos y para voz, y viene con DeepL Write para pulir la redacción. Incluye funciones de estilo, como ajustar el tono formal o informal y usar un glosario.
Un servicio de Google: al entrar aparece primero la pantalla de inicio de sesión con una cuenta de Google, disponible en varios idiomas, incluido el coreano.
Un buscador con IA: escribes la pregunta como una frase y devuelve una respuesta ordenada tras rastrear la web. Debajo del campo de entrada eliges el modo de búsqueda y el modelo, y hay también un botón de entrada por voz. En el menú de la izquierda están los espacios, los artefactos y el historial, para volver a abrir conversaciones anteriores.
Un visor para girar en el navegador una escena 3D (un gaussian splat) hecha a partir de varias fotos. Lo creó Kevin Kwok y el código está publicado en GitHub. Puedes mover la cámara y recorrer la escena como si caminaras por ella, con los cuadros por segundo en una esquina de la pantalla.
Un servicio de generación de mundos 3D creado por World Labs. Le das una frase, una imagen, un video o una estructura 3D y arma un espacio tridimensional que puedes recorrer. También trae una galería con los mundos que hizo otra gente.
Un servicio experimental en el que la IA convierte en video, en tiempo real, la escena que describas con palabras. No reproduce un video ya hecho: recibe el prompt y va dibujando la escena sobre la marcha. Las simulaciones que crees se guardan en la lista de tu cuenta.
Un experimento de investigación en línea del Departamento de Ciencias de la Computación de la Universidad Northwestern. Te muestran un discurso corto y tienes que decidir si son palabras del lado demócrata o del republicano, con una pista explicativa que te ayuda a decidir. La investigación estudia qué tan bien distinguimos lo real de lo falso y de dónde viene cada cosa.
Una herramienta para abrir las Content Credentials de una imagen o un video, es decir, su historial de creación y edición. Al subir el archivo muestra paso a paso cuándo y con qué herramienta se creó y cómo fue cambiando. Va muy bien para comprobar por tu cuenta el origen declarado de algo generado por IA.
Una herramienta gratuita y de código abierto que amplía y restaura video o imágenes dentro del propio navegador. Ejecuta con WebGPU algoritmos de ampliación como Anime4K y RealESRGAN, así que el archivo no se sube a ningún servidor. Según indica, funciona especialmente bien con video de trazo marcado, como la animación.
Un editor para abrir y retocar en el navegador archivos de gaussian splat, el resultado de un escaneo 3D. Al cargar la escena puedes girarla en la vista 3D, seleccionar y borrar los puntos que sobran y ajustar posición, rotación y tamaño. Es una herramienta web que corre sin instalar nada.
Una herramienta de creación generativa que hace video a partir de texto o de una imagen. Además de generar video reúne en una misma pantalla generación de imágenes, control de movimiento, lienzo y avatares. En la primera pantalla van pasando los videos que subió otra gente.
Una herramienta de captura de movimiento que lee el movimiento de una persona en el video de la cámara o en un video subido y lo convierte en datos de animación 3D. Registra el movimiento solo con la cámara, sin sensores aparte, para aplicarlo a un personaje. En la pantalla actual avisan además de que el servicio está pasando a llamarse Rokoko Create.
Un juego para aprender el alfabeto dactilológico de la lengua de señas americana (ASL) imitando las formas de la mano frente a la cámara. Trabaja las formas de la A a la Z del ASL, no de la lengua de señas coreana. Lo hizo la American Society for Deaf Children y usa MediaPipe Hands para reconocer la mano.
Una demo de TensorFlow.js que estima la profundidad a partir de un solo retrato y lo convierte en una foto 3D con movimiento. Muestra en paralelo el original, la persona recortada, el mapa de profundidad y el resultado 3D, así que se ve cada etapa. El resultado se descarga como GIF o WebM.
Una herramienta para ver con qué unidades (tokens) parte un modelo de lenguaje una frase. Al escribir un texto aparecen al momento el número de tokens, los fragmentos separados por colores y el número identificador de cada uno. También puedes ver con qué marcas especiales llega realmente al modelo una conversación.
Una visualización que despliega en tres dimensiones el interior de una red convolucional (CNN) que adivina dígitos escritos a mano. Se ve cómo la imagen se va resumiendo en valores cada vez más pequeños y abstractos al pasar de la capa de entrada a las convolucionales, las de submuestreo, las totalmente conectadas y la de salida. Queda claro que una red neuronal no es una caja negra maciza, sino capas con papeles distintos puestas una tras otra.
Un material educativo que muestra, en un juego de unos seis minutos, cómo una IA de contratación hereda tal cual los sesgos de las personas. Eres el director de una empresa y eliges tú a los candidatos hasta que, para ir más rápido, le pasas la criba a una IA que aprendió de tus decisiones. Al ver que esa IA empieza a descartar a cierto tipo de candidatos, se entiende que el sesgo no nace en el algoritmo, sino que llega a través de los datos de entrenamiento.
Un sitio que plantea, una tras otra, situaciones en las que un auto sin conductor y sin frenos tiene que decidir a quién atropella, y en las que tú eliges, como observador externo, qué desenlace te resulta aceptable. Al terminar todos los escenarios, tu forma de decidir se resume comparada con la de otras personas. Sirve para pensar con qué criterio dejamos en manos de una máquina una decisión que hiere a alguien, y cuánto varía ese criterio de una persona a otra.
Un ensayo visual de Google PAIR que hace que el modelo de lenguaje BERT rellene el hueco de una frase para examinar qué aprendió sobre el mundo. Con frases como "in texas, they like to buy ___" puedes comprobar que basta cambiar el nombre de un lugar para que cambien las palabras candidatas y su orden de probabilidad. Se entiende que la predicción de un modelo de lenguaje no es conocimiento neutral, sino una asociación estadística presente en los textos con los que se entrenó, y que por eso también aprende los sesgos sociales.
Una colección de explicaciones visuales de conceptos de aprendizaje automático hecha por Machine Learning University, el programa educativo de Amazon. Catorce artículos —redes neuronales, regresión lineal y logística, árboles de decisión y bosques aleatorios, precisión y exhaustividad, ROC y AUC, validación cruzada, el equilibrio entre sesgo y varianza— organizados para que muevas los gráficos con la mano. Ves qué forma toman en un dibujo conceptos que con puras fórmulas no terminaban de encajar.
Una herramienta de TensorFlow que reduce a dos o tres dimensiones los embeddings —datos como palabras representados en vectores de cientos de dimensiones— para poder verlos. Al abrirla aparecen como puntos 10.000 palabras de Word2Vec en 200 dimensiones, y al elegir una se listan sus palabras vecinas más cercanas. Comprueban con los ojos la propiedad básica de los embeddings: las palabras de significado parecido se agrupan cerca en el espacio.
Una herramienta para seguir paso a paso cómo word2vec va construyendo los vectores de palabras. Le das datos de entrenamiento muy pequeños, como "eat|apple, drink|milk", y al avanzar el entrenamiento cambian poco a poco los colores de las matrices de pesos de entrada y salida mientras los puntos de las palabras van encontrando su lugar en el gráfico PCA de abajo. Se entiende que un embedding no es un valor fijado de antemano, sino algo que se va formando a base de repetir el entrenamiento.
El curso de introducción al aprendizaje automático de Google, uno de los pocos de este catálogo con texto e índice en coreano. Cada módulo —regresión lineal y logística, clasificación, manejo de datos, redes neuronales, embeddings, grandes modelos de lenguaje, sistemas de ML en producción y equidad— indica el tiempo estimado, así que se puede seguir en orden. En la página enlazada de práctica interactiva con redes neuronales editas capas ocultas y pesos y compruebas qué cambio afecta al cálculo de cada nodo.
Una demo para poner en distintos terrenos a agentes entrenados con aprendizaje por refuerzo profundo —un robot bípedo, un chimpancé y un pez— y mirar cómo se mueven. Además de cargar los terrenos preparados, puedes dibujar tú el suelo y el techo para crear situaciones que el agente nunca vio durante el entrenamiento. Así se comprueba en carne propia el problema de la generalización: lo aprendido funciona bien en un entorno conocido, pero puede derrumbarse si el entorno cambia.
Una herramienta de visualización que pone en una sola pantalla, capa por capa y cabeza por cabeza, los patrones de atención de un modelo transformador para compararlos. Como proyecta en el mismo espacio los vectores de consulta y de clave, se ve de un vistazo que cada cabeza forma un patrón con una forma completamente distinta. Se comprueba que las cabezas de atención miran relaciones diferentes entre sí; está pensada para quien ya conoce la arquitectura del transformador.
Un conjunto de demos de una biblioteca JavaScript pensada para ejecutar algoritmos de aprendizaje por refuerzo directamente en el navegador. Puedes ver cómo se fijan los valores en un mundo de cuadrícula con programación dinámica y con aprendizaje por diferencias temporales (SARSA y Q-learning), y cómo se mueve un agente de Q-learning profundo (DQN) con red neuronal en PuckWorld y WaterWorld. Se comprueba la idea básica del aprendizaje por refuerzo: con solo dar recompensas y castigos, la conducta se va afinando.
Una herramienta que abre el archivo de una red neuronal ya entrenada y dibuja la estructura de capas que hay dentro. Puedes seguir en pantalla qué capas hay y en qué orden se encadenan.
Un servicio que ejecuta el modelo de lenguaje dentro del propio navegador para conversar con él. Se diferencia de otros chatbots en que la conversación no se envía a ningún servidor y se procesa solo en tu computadora. La pantalla admite coreano.
Un ecosistema virtual en dos dimensiones donde criaturas formadas por células de varios colores se reproducen, compiten y evolucionan. Cada color tiene un papel distinto, y puedes observar cómo, con las generaciones, las mutaciones van cambiando su forma y su conducta.
Una página de práctica para entrenar tú mismo una red neuronal pequeña dentro del navegador. Al cambiar el número de capas y de neuronas, la función de activación o la tasa de aprendizaje, ves cómo cambia la frontera que separa los datos. No descarga ningún modelo, así que funciona en cuanto la abres.
Una colección para probar una tras otra, en una sola página, quince funciones de reconocimiento de Google MediaPipe. Incluye detección de rostro, manos y postura, reconocimiento de gestos, clasificación y segmentación de imágenes, detección de objetos, clasificación de sonido, identificación de idioma y clasificación de texto. El cálculo ocurre dentro del navegador.
Una página que muestra con colores en qué fragmentos (tokens) se parte la frase que escribas dentro de un modelo de IA. Puedes elegir y comparar los tokenizadores de trece modelos: GPT-4, Claude, Llama 3, Gemma, Mistral, BERT, T5 y otros.
Una página que toma una foto y un cuadro y vuelve a dibujar la foto con el estilo de ese cuadro. El cálculo ocurre en el navegador con TensorFlow.js, así que la foto no se sube a ningún servidor. También tiene una pestaña para mezclar dos estilos.
Una colección de artículos que muestra con varias demos cómo se hace evolucionar una red neuronal generación tras generación. Hay ejemplos como agentes que buscan un objetivo, una IA de juego al estilo de Agar.io y clasificación de colores, para ver cómo mejora el rendimiento por selección y mutación en lugar de por entrenamiento.








































































































































