REINFORCEjs (demos de algoritmos de aprendizaje por refuerzo)
Un conjunto de demos de una biblioteca JavaScript pensada para ejecutar algoritmos de aprendizaje por refuerzo directamente en el navegador. Puedes ver cómo se fijan los valores en un mundo de cuadrícula con programación dinámica y con aprendizaje por diferencias temporales (SARSA y Q-learning), y cómo se mueve un agente de Q-learning profundo (DQN) con red neuronal en PuckWorld y WaterWorld. Se comprueba la idea básica del aprendizaje por refuerzo: con solo dar recompensas y castigos, la conducta se va afinando.

Cómo probarlo
En el menú de arriba elige "GridWorld: DP", "GridWorld: TD", "PuckWorld: DQN" o "WaterWorld: DQN" para ejecutar esa demo y observar cómo cambian, según avanza el entrenamiento, los valores y las flechas de las casillas o el movimiento del agente. El texto About de la primera página resume para qué situación sirve cada uno de los cuatro métodos, lo que ayuda a decidir por dónde empezar. La pantalla y las explicaciones están solo en inglés.