Inteligencia artificial · Aprendizaje por refuerzo

Una IA que aprende sola a jugar.

Nadie le programó las reglas. Mira la pantalla como lo haría una persona, detecta los obstáculos y descubre —por ensayo y recompensa— el momento exacto de saltar en el juego del dinosaurio de Chrome. Cada intento la hace mejor.

PPO
Aprendizaje por refuerzo
Visión
Detecta obstáculos en pantalla
Auto
Mejora sola con cada intento
Qué hace

Aprende a jugar igual que una persona: mirando

Sin trucos ni acceso al código del juego. Solo la pantalla, los ojos (visión por computadora) y la experiencia.

Ve la pantalla

Captura el juego en tiempo real y, con visión por computadora (OpenCV), detecta dónde está el dinosaurio y los obstáculos que se acercan.

Decide en milisegundos

En cada instante elige una acción —saltar o seguir— buscando esquivar lo que viene. Reacciona más rápido de lo que parpadeas.

Aprende por recompensa

Cada vez que sobrevive un poco más, recibe una recompensa. El algoritmo PPO ajusta su "instinto" para repetir lo que funciona y evitar lo que la mata.

Mejora con cada intento

Empieza torpe y termina experta. Episodio tras episodio su puntaje sube — la curva de aprendizaje lo demuestra.

Dos enfoques

Una red neuronal entrenada que aprende sola, y una versión por reglas fijas. Ideal para comparar la IA contra un script tradicional.

Visualiza lo que "ve"

Un modo de depuración muestra exactamente la región del juego que la IA está analizando y los obstáculos que detecta, dibujados en pantalla. Transparencia total sobre su razonamiento.

Cómo funciona

El ciclo de aprendizaje

El mismo bucle que usan los sistemas de IA que aprenden a conducir o a jugar: observar, actuar, recompensar, repetir.

Observa

Captura la pantalla y detecta dino y obstáculos con OpenCV.

Actúa

La red neuronal (PPO) elige saltar o no, según lo que ve.

Recompensa

Sobrevivir suma puntos; chocar los resta.

Aprende

Ajusta sus decisiones para maximizar la recompensa futura.

Bajo el capó

Tecnología

Aprendizaje por refuerzo

PPO con Stable-Baselines3 y un entorno Gymnasium a la medida (observación, acciones y recompensa).

Visión por computadora

OpenCV + captura de pantalla para detectar obstáculos por imagen, sin leer la memoria del juego.

Redes neuronales

PyTorch entrena la política que decide cada acción; el modelo se guarda y se reutiliza.

Mira a la IA jugar sola

Todo el código está abierto: el entorno, el entrenamiento y el script que carga el modelo y juega de forma autónoma.