ملاحظات المشروع · Goh Kun Ming
Pendulum Learning Lab
AI · تجربة في دفتر برمجي
يوليو 2025 – أغسطس 2025
نظرة عامة على المشروع
تعلم التحكم عبر المحاولة والمكافأة والتقييم.
مختبر للتعلم المعزز يقارن Standard وDouble وDueling وRainbow DQN في بيئة Pendulum-v1. يحوّل عزم الدوران المستمر إلى أفعال متقطعة، مع مكونات قابلة لإعادة الاستخدام لإعادة تشغيل الخبرات والتدريب والتقييم والضبط. تُفصل اختبارات التشغيل الأولية المحلية عن الدراسات الكاملة؛ ولا يُدّعى تفوق المكافآت أو استقرار التحكم عبر تجارب متكافئة تستخدم عدة بذور عشوائية.
داخل هذا المشروع
- تم تعيين عزم الدوران المستمر لصناديق العمل المنفصلة للتعلم القائم على القيمة.
- أعدّ تجارب ببذور عشوائية محددة، ومخازن لإعادة تشغيل الخبرات، ومرحلة تهيئة، وتحديثات للشبكة الهدف.
- تمت إضافة إعادة التشغيل ذات الأولوية ومخرجات التوزيع لـ Rainbow DQN.
- توفير ملخصات المكافآت، وتحليل منحنى التعلم، والطرح الجشع، وطرق المقارنة.
- فصل اختبارات التشغيل الأولية المحدودة عن إعداد الدراسة الكاملة المكوّنة من 500 حلقة.
- تم التحقق من صحة أدوات التجربة وتكامل دفتر برمجي أثناء توثيق عمليات التشغيل المتعددة البذور المتطابقة المفقودة.












