Notas do projeto · Goh Kun Ming
Pendulum Learning Lab
IA · Experimento em notebook
jul. de 2025 – ago. de 2025
Visão geral do projeto
Aprendendo controle por tentativa, recompensa e avaliação.
Um laboratório de aprendizado por reforço que compara Standard, Double, Dueling e Rainbow DQN no Pendulum-v1. Converte torque contínuo em ações discretas, com componentes reutilizáveis de replay, treinamento, avaliação e ajuste. Os testes básicos locais são separados dos estudos completos; não se afirma superioridade de recompensa ou estabilidade de controle em comparações equivalentes com múltiplas sementes aleatórias.
Por dentro deste projeto
- Torque contínuo mapeado para compartimentos de ação discretos para aprendizado baseado em valor.
- Configurou experimentos com sementes aleatórias definidas, buffers de replay, aquecimento e atualizações da rede-alvo.
- Adicionadas saídas de distribuição e reprodução priorizadas para Rainbow DQN.
- Forneceu resumos de recompensas, análises de curva de aprendizado, implementações gananciosas e visualizações de comparação.
- Separou as execuções limitadas de verificação básica da configuração completa do estudo com 500 episódios.
- Ferramentas de experimento validadas e integridade do notebook enquanto documentam execuções de múltiplas sementes correspondentes ausentes.












