Notes de réalisation · Goh Kun Ming
Pendulum Learning Lab
IA · Expérience en notebook
juil. 2025 – août 2025
Présentation du projet
Apprendre le contrôle par l’essai, la récompense et l’évaluation.
Un laboratoire d’apprentissage par renforcement comparant les DQN Standard, Double, Dueling et Rainbow sur Pendulum-v1. Le couple continu est converti en actions discrètes, avec des composants réutilisables de rejeu, d’entraînement, d’évaluation et de réglage. Les essais locaux élémentaires sont distingués des études complètes ; aucune supériorité de récompense à graines multiples comparables ni stabilité de contrôle n’est revendiquée.
Au cœur de cette réalisation
- Converti le couple continu en intervalles d’actions discrètes pour l’apprentissage fondé sur la valeur.
- Configuré des expériences avec graines, tampons de rejeu, préchauffage et mises à jour du réseau cible.
- Ajouté le rejeu prioritaire et les sorties distributionnelles pour Rainbow DQN.
- Fourni des résumés de récompense, analyses de courbes d’apprentissage, exécutions gloutonnes et vues comparatives.
- Séparé les essais élémentaires bornés de la configuration complète de l’étude à 500 épisodes.
- Validé les outils expérimentaux et l’intégrité des carnets en documentant l’absence d’exécutions comparables à graines multiples.












