作品笔记 · Goh Kun Ming
Pendulum Learning Lab
AI · 笔记本实验
2025年7月 – 2025年8月
项目概述
通过尝试、奖励与评估学习控制。
一个在 Pendulum-v1 上比较 Standard、Double、Dueling 和 Rainbow DQN 的强化学习实验项目。它将连续力矩映射为离散动作,并提供可复用的回放、训练、评估和调参组件。本地冒烟运行与完整研究明确区分,不宣称在匹配的多随机种子实验中取得回报优势或控制稳定性。
作品详情
- 将连续力矩映射为离散动作区间,以支持基于价值的学习。
- 配置带随机种子的实验,包含回放缓冲区、预热和目标网络更新。
- 为 Rainbow DQN 添加优先经验回放和价值分布输出。
- 提供回报汇总、学习曲线分析、贪心策略运行和比较视图。
- 将有限规模的冒烟运行与完整的 500 回合研究配置分开。
- 验证实验工具和笔记本完整性,并记录缺少匹配的多随机种子运行。












