Notas de la creación · Goh Kun Ming
Pendulum Learning Lab
IA · Experimento en cuaderno
jul 2025 – ago 2025
Resumen del proyecto
Aprender el control mediante prueba, recompensa y evaluación.
Un laboratorio de aprendizaje por refuerzo que compara DQN estándar, Double, Dueling y Rainbow en Pendulum-v1. El par continuo se convierte en acciones discretas, con componentes reutilizables de repetición, entrenamiento, evaluación y ajuste. Las ejecuciones locales de comprobación se distinguen de los estudios completos; no se afirma superioridad de recompensa con múltiples semillas equivalentes ni estabilidad de control.
Dentro de esta creación
- Convertí el par continuo en intervalos de acciones discretas para el aprendizaje basado en valor.
- Configuré experimentos con semillas, búferes de repetición, calentamiento y actualizaciones de la red objetivo.
- Añadí repetición priorizada y salidas distribucionales para Rainbow DQN.
- Proporcioné resúmenes de recompensa, análisis de curvas de aprendizaje, ejecuciones con política voraz y vistas comparativas.
- Separé ejecuciones básicas acotadas de la configuración del estudio completo de 500 episodios.
- Validé herramientas experimentales e integridad de cuadernos y documenté la falta de ejecuciones equivalentes con múltiples semillas.












