Nota binaan · Goh Kun Ming
Pendulum Learning Lab
AI · Eksperimen buku nota
Jul 2025 – Ogo 2025
Gambaran projek
Mempelajari kawalan melalui percubaan, ganjaran dan penilaian.
Makmal pembelajaran pengukuhan yang membandingkan Standard, Double, Dueling dan Rainbow DQN pada Pendulum-v1. Tork berterusan dipetakan kepada tindakan diskret, dengan komponen ulang tayang, latihan, penilaian dan penalaan boleh guna semula. Pelaksanaan ujian asas setempat dibezakan daripada kajian penuh; kelebihan ganjaran berbilang benih yang sepadan dan kestabilan kawalan tidak didakwa.
Di dalam binaan ini
- Memetakan tork berterusan kepada julat tindakan diskret bagi pembelajaran berasaskan nilai.
- Mengkonfigurasi eksperimen berbenih dengan penimbal ulang tayang, pemanasan dan kemas kini rangkaian sasaran.
- Menambah ulang tayang berkeutamaan dan output taburan untuk Rainbow DQN.
- Menyediakan ringkasan ganjaran, analisis lengkung pembelajaran, pelaksanaan dasar tamak dan paparan perbandingan.
- Memisahkan larian ujian asas terhad daripada konfigurasi kajian penuh 500 episod.
- Mengesahkan alat eksperimen dan integriti notebook sambil mendokumenkan ketiadaan larian berbilang benih yang sepadan.












