படைப்புக் குறிப்புகள் · Goh Kun Ming
Pendulum Learning Lab
AI · நிரலாக்கக் குறிப்பேட்டுச் சோதனை
ஜூலை 2025 – ஆக. 2025
திட்டக் கண்ணோட்டம்
முயற்சி, வெகுமதி மற்றும் மதிப்பீடு மூலம் கட்டுப்பாட்டைக் கற்றல்.
Pendulum-v1 சூழலில் Standard, Double, Dueling மற்றும் Rainbow DQN முறைகளை ஒப்பிடும் வலுவூட்டல் கற்றல் ஆய்வகம். தொடர்ச்சியான முறுக்குவிசை தனித்தனி செயல்களாக மாற்றப்படுகிறது; அனுபவ மீள்பயன்பாடு, பயிற்சி, மதிப்பீடு மற்றும் அளவுருத் தேர்வுக்கான கூறுகள் மீண்டும் பயன்படுத்தக்கூடியவை. உள்ளூரில் செய்யும் குறுகிய செயல்பாட்டுச் சோதனைகள் முழு ஆய்வுகளிலிருந்து வேறுபடுத்தப்பட்டுள்ளன; பல சீரற்ற தொடக்கமதிப்புகளுடன் ஒப்பிடத்தக்க சோதனைகளில் அதிக வெகுமதி அல்லது நிலையான கட்டுப்பாடு நிரூபிக்கப்பட்டதாகக் கூறப்படவில்லை.
இந்தப் படைப்பிற்குள்
- மதிப்பு அடிப்படையிலான கற்றலுக்கான தனித்துவமான செயல் தொட்டிகளுக்கு தொடர்ச்சியான முறுக்குவிசை வரைபடமாக்கப்பட்டது.
- நிர்ணயிக்கப்பட்ட சீரற்ற தொடக்கமதிப்புகள், அனுபவ மீள்பயன்பாட்டு இடைநிலைகள், ஆரம்பத் தயாரிப்பு மற்றும் இலக்கு வலையமைப்புப் புதுப்பிப்புகளுடன் சோதனைகளை அமைத்தது.
- Rainbow DQN க்கான முன்னுரிமை மறு இயக்கம் மற்றும் விநியோக வெளியீடுகள் சேர்க்கப்பட்டது.
- வெகுமதி சுருக்கங்கள், கற்றல்-வளைவு பகுப்பாய்வு, பேராசையான வெளியீடுகள் மற்றும் ஒப்பீட்டுக் காட்சிகள் வழங்கப்பட்டுள்ளன.
- முழுமையான 500-சுற்று ஆய்வு அமைப்பிலிருந்து குறுகிய அடிப்படைச் செயல்பாட்டுச் சோதனைகளைத் தனியாக வைத்தது.
- சரிபார்த்த சோதனை கருவி மற்றும் நோட்புக் ஒருமைப்பாடு, காணாமல் போன பல-விதை ஓட்டங்களை ஆவணப்படுத்துகிறது.












