التعلم المعزز متعدد الوكلاء، بناءً تدريجيًا من روبوت واحد
يسير كل فصل على النهج نفسه: ما يفعله المفهوم عمليًا، ثم الآليات التقنية، ثم النظرية والمعادلات. في كل فصل مختبر تفاعلي يمكنك التحكم فيه بنفسك. لا يحتاج أي شيء هنا في البداية إلى أكثر من جبر المرحلة الثانوية والاحتمالات وقليل من التفاضل والتكامل. وبنهاية الدليل ستكون قد بلغت مستوى البحث العلمي.
حلقة الوكيل–البيئة
تخيّل روبوتًا في مستودع. عشر مرات في الثانية يقرأ حساساته، ويختار أمرًا للمحركات، فيستجيب العالم: يتحرك، وربما يصطدم برفّ، وربما يصل إلى نقطة الالتقاط. لا أحد يخبره بالأمر الصحيح. كل ما يحصل عليه رقم، هو المكافأة (reward)، يخبره بمدى جودة تلك اللحظة. والتعلم المعزز (Reinforcement Learning, RL) هو هندسة تحويل هذه الأرقام إلى سلوك جيد.
# الحلقة التي تنفّذها كل مكتبة للتعلم المعزز (واجهة Gymnasium البرمجية) obs, info = env.reset() for t in range(T): action = policy(obs) # الوكيل يقرّر obs, reward, terminated, truncated, info = env.step(action) # العالم يستجيب if terminated or truncated: break
| المصطلح | الرمز | روبوت المستودع | السيارة ذاتية القيادة |
|---|---|---|---|
| الحالة (State) | \(s_t\) | الوضعية، البطارية، خريطة الرفوف | وضعية المركبة الذاتية وسرعتها، جميع المركبات القريبة، الإشارات الضوئية |
| الملاحظة (Observation) | \(o_t\) | مسح LiDAR، قياس دوران العجلات (odometry) | كاميرا + LiDAR + رادار، أي ما تراه الحساسات فعلًا |
| الفعل (Action) | \(a_t\) | {أمام، يسار، يمين، توقف} | زاوية التوجيه، التسارع (مستمر) |
| المكافأة (Reward) | \(r_{t+1}\) | +10 عند الالتقاط، −1 لكل ثانية | +التقدّم، −الاصطدام، −الارتجاج (jerk) |
| السياسة (Policy) | \(\pi(a\mid s)\) | المتحكم الذي نتعلّمه: دالة تربط الموقف بالأفعال (أو بتوزيع احتمالي عليها) | |
| الحلقة (Episode) | — | رحلة توصيل واحدة | عبور واحد لتقاطع طرق |
قُد الروبوت بنفسك
المختبر 1 · أنت السياسةاستخدم لوحة الأزرار أو مفاتيح الأسهم (انقر على المختبر أولًا). اوصل إلى الهدف الأخضر (+10)؛ الخلايا الحمراء حُفَر (−10)؛ وكل خطوة تكلّف −1. فعّل الأرضية الزلقة فتنحرف أوامرك أحيانًا إلى الجانب. هذه العشوائية هي احتمال الانتقال \(P\) الذي ستتعرّف عليه في الفصل 3.
العائد والخصم: ما الذي يعظّمه الوكيل فعلًا
السيارة التي لا تعظّم إلا مكافأة هذه الثانية ستضغط دواسة الوقود حتى آخرها نحو طابور من السيارات. نريدها أن تهتم بالرحلة كلها، لكن أن تهتم أقل قليلًا بالمستقبل البعيد، فهو غير مؤكد على أي حال. نحقق ذلك بواسطة معامل الخصم (discount factor) \(\gamma\in[0,1)\).
العائد (return) ابتداءً من الزمن \(t\) هو المجموع المخصوم للمكافآت (rewards) المستقبلية:
وهو يحقق علاقة تكرارية يُبنى عليها بقية التعلم المعزز (RL):
إذا كانت المكافآت محدودة، \(|r|\le R_{\max}\)، فإن المتسلسلة الهندسية تعطي \(|G_t|\le R_{\max}/(1-\gamma)\)، أي أن المجموع منتهٍ. والأفق الفعلي (effective horizon) يساوي تقريبًا \(1/(1-\gamma)\) خطوة. قاعدة تقريبية للروبوتات: الأفق بالثواني ≈ \(\frac{1}{1-\gamma}\cdot \Delta t\). اختر \(\gamma\) بناءً على تردد التحكم وعلى المدى الذي تتطلب المهمة أن تنظر إليه مسبقًا. لا تختره عشوائيًا.
إلى أي مدى تنظر سيارتك إلى الأمام؟
المختبر 2 · أوزان الخصمتُظهر الأعمدة الوزن \(\gamma^k\) المعطى لمكافأة تقع على بُعد \(k\) خطوة. حرّك γ ومعدل التحكم، واقرأ أفق التخطيط الناتج.
عمليات قرار ماركوف ومعادلة بلمان
لكي نفكر في الروبوت رياضيًا، نصف عالمه بخمسة مكوّنات: ما المواقف الموجودة، وما الأفعال المتاحة، وكيف تغيّر الأفعال المواقف (مع وجود ضوضاء)، وما قيمة كل نتيجة، وبأي قدر نخصم المستقبل. هذه الحزمة هي عملية قرار ماركوف (MDP).
خاصية ماركوف (Markov property): يعتمد المستقبل على الحالة الحاضرة فقط، لا على الطريقة التي وصلت بها إليها: \(\Pr(s_{t+1}\mid s_t,a_t) = \Pr(s_{t+1}\mid s_0,a_0,\dots,s_t,a_t)\). بالنسبة للسيارة، الموقع والسرعة معًا يحققان خاصية ماركوف؛ أما الموقع وحده فلا.
تقيس دالتا قيمة (value functions) مدى جودة الأمور تحت سياسة (policy) \(\pi\):
تجيب \(V\) عن سؤال "ما مدى جودة أن أكون هنا؟"، وتجيب \(Q\) عن سؤال "ما مدى جودة أن أفعل هذا هنا؟". وبمجرد معرفة \(Q\) يصبح التصرف سهلًا: اختر \(\arg\max_a Q(s,a)\).
عوّض \(G_t = r_{t+1}+\gamma G_{t+1}\) في التعريف وخذ القيم المتوقعة. ستحصل على شرط اتساق لخطوة واحدة:
أما القيمة المثلى فتستبدل "المتوسط على السياسة" بـ"اختيار أفضل فعل":
عرّف مؤثر أمثلية بلمان (Bellman optimality operator) \(\mathcal{T}\) على أنه الطرف الأيمن. إنه \(\gamma\)-انكماش (contraction) بالنسبة لمعيار القيمة العظمى (max-norm): \(\|\mathcal{T}V - \mathcal{T}U\|_\infty \le \gamma \|V-U\|_\infty\). وبحسب مبرهنة باناخ للنقطة الثابتة (Banach fixed-point theorem) له نقطة ثابتة واحدة بالضبط هي \(V^*\)، وتطبيقه بشكل متكرر (تكرار القيمة (value iteration)) يتقارب من أي نقطة بداية. كل مسح يقلّص الخطأ بمعامل \(\gamma\) على الأقل.
شاهد القيمة تنتشر إلى الخلف انطلاقًا من الهدف
المختبر 3 · تكرار القيمةاضغط مسح واحد وشاهد القيمة تنتشر إلى الخارج من الهدف. تُظهر الأسهم السياسة الجشعة (greedy policy). انقر على خلية لترى حساب تحديث بلمان (Bellman backup) الخاص بها مفصّلًا. انتقل إلى تحرير الخريطة وانقر على الخلايا للتنقل بين فارغة ← جدار ← حفرة، ثم لاحظ كيف تعيد السياسة رسم المسار. ارفع احتمال الانزلاق فيبدأ الروبوت بالابتعاد عن الحُفَر.
التعلم من التجربة: مونت كارلو والفرق الزمني
مونت كارلو (Monte Carlo, MC): قُد المسار كاملًا، وسجّل إجمالي المكافأة، واحسب متوسطه على رحلات كثيرة. الفرق الزمني (Temporal Difference, TD): بعد كل خطوة منفردة، حدّث تقديرك باستخدام المكافأة التي حصلت عليها للتو مضافًا إليها تقديرك الحالي للمكان الذي وصلت إليه. يتعلم TD أثناء القيادة ولا يحتاج إلى انتهاء الرحلة.
كلتاهما تعني "حرّك التقدير بنسبة \(\alpha\) نحو هدف ما". والفرق بينهما هو الهدف.
| مونت كارلو | TD(0) | |
|---|---|---|
| الهدف | \(G_t\): عائد حقيقي مأخوذ من عينة | \(r+\gamma V(s')\): يستخدم تقديره الخاص (التمهيد الذاتي (bootstrapping)) |
| الانحياز (Bias) | غير منحاز: \(\mathbb{E}[G_t]=V^\pi(s_t)\) | منحاز ما دامت \(V\) خاطئة |
| التباين (Variance) | مرتفع: يجمع مكافآت عشوائية كثيرة | منخفض: مكافأة عشوائية واحدة وانتقال واحد |
| يحتاج إلى نهاية الحلقة؟ | نعم | لا، يتعلم أثناء التشغيل (online) |
| افتراض ماركوف | غير مطلوب | يستثمره (أفضل في العوالم الماركوفية) |
وبينهما تقع العوائد متعددة الخطوات (n-step returns) وTD(λ)، اللتان تمزجان أهدافًا بكل الأطوال. وGAE في PPO (الفصل 6) هو هذه الفكرة بعينها مطبّقة على دوال الميزة (advantages). التقارب: يتقارب TD(0) الجدولي إلى \(V^\pi\) في ظل أحجام خطوات روبنز–مونرو (Robbins–Monro) (\(\sum\alpha_t=\infty,\ \sum\alpha_t^2<\infty\)).
MC مقابل TD في مسار عشوائي من 5 حالات
المختبر 4 · المثال الكلاسيكي لساتون وبارتويبدأ روبوت من C ويتحرك يسارًا أو يمينًا عشوائيًا. الخروج من اليمين يعطي 1، والخروج من اليسار يعطي 0. القيم الحقيقية هي A=1/6 … E=5/6. شغّل حلقات وقارن سرعة وصول كل مقدِّر إلى القيم الصحيحة. يزيل متوسط 100 تشغيل أثر الحظ ويُظهر منحنى التعلم النموذجي.
التحكم: Q-learning وSARSA والاستكشاف
تقييم سياسة (policy) ثابتة لا يكفي. نريد للروبوت أن يتحسّن. احتفظ بجدول \(Q(s,a)\)، وتصرّف في الغالب بجشع (greedily)، وجرّب أحيانًا فعلًا عشوائيًا (ε-greedy). إذا لم يجرّب الروبوت المسار غير المألوف أبدًا، فلن يكتشف أبدًا أن ذلك المسار أفضل.
Q-learning خارج السياسة (off-policy): يتعلم قيمة السياسة الجشعة بينما يتصرف بأسلوب ε-greedy، وذلك بفضل \(\max\). أما SARSA فهو ضمن السياسة (on-policy): يتعلم قيمة ما يفعله فعلًا، بما في ذلك الاستكشاف، ولذلك يتعلم مسارات أكثر أمانًا بالقرب من المنحدرات والحُفَر. هذا التمييز يتكرر كثيرًا في النقاشات المتعلقة بسلامة الروبوتات.
يتقارب Q-learning الجدولي إلى \(Q^*\) باحتمال 1 (Watkins & Dayan, 1992) إذا زِير كل زوج حالة–فعل عددًا لانهائيًا من المرات وحققت أحجام الخطوات شروط روبنز–مونرو. إنه تقريب عشوائي (stochastic approximation) للنقطة الثابتة لمعادلة أمثلية بلمان من الفصل 3. تذكّر هذا جيدًا: يفترض البرهان بيئة ثابتة (stationary). وفي MARL يكون الوكلاء المتعلمون الآخرون جزءًا من البيئة، فينهار هذا الافتراض. وهذه هي المشكلة الجذرية في الفصل 7.
درّب روبوتًا باستخدام Q-learning
المختبر 5 · Q-learning الجدوليدرّب على دفعات وشاهد الأسهم الجشعة تستقر. جرّب ε = 0: كثيرًا ما يعلق الروبوت في أول مسار متوسط الجودة يجده. ثم اضغط شاهد تشغيلًا جشعًا.
التعلّم المعزَّز العميق (Deep RL): DQN، وتدرّجات السياسة، والفاعل–الناقد، و PPO
حالة السيارة متصلة وعالية الأبعاد، فلا يمكن لأي جدول أن يستوعبها. لذا نستبدل الجدول بشبكة عصبية، \(Q_\theta(s,a)\) أو \(\pi_\theta(a\mid s)\). والتوجيه ودوّاسة الوقود متغيّران متصلان، مما يجعل «أخذ القيمة العظمى على الأفعال» أمرًا مُربكًا، ولذلك كثيرًا ما نتعلّم السياسة مباشرةً.
ثمة عاملا تثبيت. مخزن إعادة التشغيل (replay buffer) \(\mathcal{D}\) يكسر الارتباط بين العيّنات المتتالية. والشبكة الهدف (target network) \(\bar\theta\)، وهي نسخة تُحدَّث ببطء، تمنع الهدف من ملاحقة نفسه. ويعالج Double DQN مشكلة المبالغة في التقدير الناتجة عن أخذ القيمة العظمى. أمّا عدم الاستقرار فمصدره الثالوث القاتل (deadly triad): تقريب الدوال + التمهيد الذاتي (bootstrapping) + البيانات خارج السياسة (off-policy).
نعظّم \(J(\theta)=\mathbb{E}_{\pi_\theta}[G_0]\) مباشرةً. وتنصّ مبرهنة تدرّج السياسة (Sutton et al., 2000) على ما يلي:
بعبارة أخرى: اجعل الأفعال التي تبيّن أنها أفضل من المتوسط (\(A>0\)) أكثر احتمالًا. تستخدم خوارزمية REINFORCE القيمة \(G_t\) بدلًا من \(A\)، وهي فكرة مونت كارلو (MC) وتعاني تباينًا مرتفعًا. أمّا الفاعل–الناقد (Actor–critic) فيتعلّم ناقدًا \(V_\phi\) ويستخدم خطأ الفرق الزمني \(\delta_t\) تقديرًا للأفضلية (advantage)، وهي فكرة الفرق الزمني (TD). ويمزج GAE بين الفكرتين: \(\hat A_t=\sum_l (\gamma\lambda)^l \delta_{t+l}\).
الخطوات الكبيرة في السياسة قد تُفسد الأداء. تحدّ PPO (Schulman et al., 2017) من مدى ابتعاد السياسة الجديدة عن السياسة التي جمعت البيانات، مستخدمةً نسبة الاحتمال \(\rho_t(\theta) = \pi_\theta(a_t\mid s_t)/\pi_{\text{old}}(a_t\mid s_t)\):
إنها تقريب رخيص من الرتبة الأولى لمنطقة الثقة (trust region) في TRPO (قيد KL). وتكتسب PPO أهميتها هنا لأن MAPPO، أقوى خط أساس بسيط في التعلّم المعزَّز متعدد الوكلاء (MARL)، ليست سوى PPO مع ناقد مركزي.
شاهِد ما يفعله القصّ
المختبر 6 · دالة PPO البديلةالخط المتقطّع: \(\rho\hat A\) دون قصّ. الخط المتصل: دالة هدف PPO. حيثما يصبح الخط المتصل مستويًا يكون التدرّج صفرًا، فلا يجد المُحسِّن سببًا لدفع النسبة أبعد من ذلك.
الخوارزميات الأساسية للتحكم المتصل: DDPG ← TD3 (ناقدان توأمان، وفاعل مؤخَّر التحديث) ← SAC (أقصى إنتروبيا، خارج السياسة، وعالية الكفاءة في استخدام العيّنات). تهيمن PPO المعتمدة على السياسة (on-policy) على المحاكاة المتوازية على نطاق واسع (روبوتات بأرجل على نمط Isaac Gym). وتشيع SAC/TD3 خارج السياسة حين تكون العيّنات مكلفة.
من وكيل واحد إلى وكلاء متعدّدين: ألعاب ماركوف، و Dec-POMDP، والتوازنات
ضع سيارتين ذاتيتي القيادة عند تقاطع بلا إشارات. ما هو أمثل للسيارة 1 يتوقف الآن على ما تفعله السيارة 2، والسيارة 2 تتعلّم هي الأخرى. فمن وجهة نظر السيارة 1، تظل البيئة تغيّر قواعدها. وأسطول روبوتات المستودعات، وقافلة الشاحنات، وسرب الطائرات المسيّرة، كلها تحمل هذه البنية.
لعبة ماركوف (العشوائية) (Markov/stochastic game) (Shapley 1953; Littman 1994) مع \(N\) وكيلًا:
تعتمد قيمة كل وكيل على السياسة المشتركة (joint policy) \(\boldsymbol\pi=(\pi_1,\dots,\pi_N)\): \(V_i^{\boldsymbol\pi}(s)=\mathbb{E}_{\boldsymbol\pi}[\sum_k\gamma^k r_{i,t+k+1}\mid s_t=s]\). والروبوتات والسيارات لا ترى إلا محليًا، وفي المهام التعاونية تتشارك مكافأة فريق واحدة، ولذلك فالنموذج المعياري هو Dec-POMDP (عملية ماركوف القرارية اللامركزية جزئية الرصد):
هنا \(\tau_i\) هو تاريخ الأفعال–الأرصاد الخاص بالوكيل \(i\). وإيجاد سياسة مثلى لـ Dec-POMDP ذات أفق منتهٍ مسألة NEXP-complete (Bernstein et al., 2002)، وهي أصعب بكثير من MDP لوكيل واحد (P-complete). ولهذا يلجأ MARL العملي إلى التقريبات والتعلّم.
| التحدي | ما الذي يسوء | مثال من القيادة / الروبوتات | العلاج المعتاد |
|---|---|---|---|
| عدم الثبات (Non-stationarity) | تتغيّر سياسات الآخرين، فينجرف كلٌّ من \(P\) و \(R\) كما يراهما الوكيل \(i\)، وتسقط براهين التقارب الخاصة بالوكيل الواحد | تتعلّم السيارة A أن تكون عدوانية؛ فتتوقف فجأة عادة «إفساح الطريق» لدى السيارة B عن أن تؤتي ثمارها | نقّاد مركزيون (CTDE)، ونمذجة الخصم، وتحديثات بطيئة / ضمن منطقة ثقة |
| إسناد الفضل (Credit assignment) | مع مكافأة مشتركة، من الذي تسبّب في النجاح؟ | توفّر القافلة الوقود: هل الفضل للشاحنة القائدة أم للثالثة؟ | تفكيك القيمة (VDN/QMIX)، وخطوط أساس مضادّة للواقع (COMA)، ومكافآت الفرق (difference rewards) |
| انفجار الفعل المشترك (Joint-action explosion) | \(|\mathcal{A}|^N\) ينمو أُسّيًا | 20 روبوتًا × 5 أفعال = \(5^{20}\approx 10^{14}\) فعلًا مشتركًا | فاعلون لامركزيون، ومشاركة المعاملات، والحقل المتوسط (mean-field)، والشبكات العصبية البيانية (GNNs) |
| قابلية الرصد الجزئية (Partial observability) | حسّاسات محلية فقط | أحد المشاة محجوب خلف شاحنة | سياسات بشبكات عصبية تكرارية (RNN)، والتواصل، وحالات الاعتقاد (belief states) |
| اختيار التوازن (Equilibrium selection) | توازنات كثيرة، وقد يختار الوكلاء توازنات متعارضة | تنتظر السيارتان كلتاهما بأدب إلى الأبد، أو تنطلقان معًا | الأعراف (conventions)، والتواصل، والتدريب المركزي |
في الألعاب ذات المجموع العام (general-sum) لا توجد سياسة «مثلى» واحدة. والمفهوم المحوري هو توازن ناش (Nash equilibrium): لا يستطيع أي وكيل أن يحقق نتيجة أفضل بتغيير سياسته وحدها.
مفاهيم ذات صلة: الاستجابة الفضلى (best response) \(\pi_i\in \arg\max V_i^{(\pi_i,\boldsymbol\pi_{-i})}\)؛ وأمثلية باريتو (Pareto optimality) (لا يمكن لأحد أن يكسب دون أن يخسر غيره)؛ والتوازن المترابط (correlated equilibrium) (إشارة مشتركة، كإشارة المرور، تنسّق بين الوكلاء). يوجد توازن ناش في الاستراتيجيات المختلطة للألعاب المنتهية (Nash 1950)، لكنه قد يكون غير كفء بمعيار باريتو. ويُظهر الإعداد المسبق لمعضلة السجين أدناه ذلك. وللألعاب صفرية المجموع (zero-sum) هناك minimax-Q (Littman 1994)؛ وللألعاب ذات المجموع العام هناك Nash-Q (Hu & Wellman 2003)، التي تحتاج إلى افتراضات قوية كي تتقارب.
سيارتان وتقاطع واحد: ديناميكيات التعلّم في فضاء السياسات
المختبر 7 · نظرية الألعاب تلتقي بالتعلّمتنفّذ كل سيارة بشكل مستقل صعودًا تدرّجيًا (gradient ascent) على عائدها الخاص. انقر في أي موضع داخل المربّع لتبدأ السيارتين عند تلك الاحتمالات، وراقب إلى أين ينتهي التعلّم المستقل. الخلايا الخضراء في الجدول هي توازنات ناش صافية. العوائد قابلة للتعديل (سيارة الصف أولًا، ثم سيارة العمود).
كيف ندرّب وكلاء كثيرين: التعلّم المركزي (CL)، والتعلّم اللامركزي (DL)، و CTDE
في المحاكاة يمكنك أن ترى كل شيء: موضع كل سيارة، وكل فعل. أمّا على الطريق الحقيقي فلا تملك كل سيارة سوى حسّاساتها الخاصة، وربما وصلة اتصال بين المركبات (V2V) متقطّعة. والنموذج السائد يستثمر هذا اللاتماثل: درِّب بالمعلومات الشاملة، ونفِّذ بالمعلومات المحلية.
التعلّم المركزي (CL)
«وكيل خارق» واحد يختار الفعل المشترك \(\mathbf a\) انطلاقًا من الحالة الشاملة. يؤول ذلك إلى MDP لوكيل واحد، لكن فضاء الأفعال يصبح \(|\mathcal{A}|^N\)، ويتطلّب تواصلًا تامًّا وقت التشغيل. ونادرًا ما يكون ذلك قابلًا للنشر على السيارات.
التعلّم اللامركزي / المستقل (DL)
يعامل كل وكيل الآخرين كجزء من البيئة: IQL و IPPO. إنه بسيط وقابل للتوسّع، لكنه يفتقر إلى ضمان التقارب بسبب عدم الثبات. ومع ذلك، فإن IPPO خط أساس قوي على نحو مفاجئ (de Witt et al., 2020).
التدريب المركزي مع التنفيذ اللامركزي (CTDE)
يستخدم الفاعلون \(\pi_i(a_i\mid\tau_i)\) الأرصاد المحلية فقط، فهم قابلون للنشر. وأثناء التدريب، يحصل ناقد أو خالط (mixer) على الحالة الشاملة \(s\) وعلى جميع الأفعال \(\mathbf a\). ومن منظور الناقد تعود البيئة ثابتة، لأنه يشترط على ما فعله الآخرون. و MAPPO و MADDPG و COMA و QMIX و VDN كلها من فئة CTDE.
بنية CTDE
مخطط| الإعداد | المكافأة | أمثلة | الخوارزميات المعتادة |
|---|---|---|---|
| تعاوني بالكامل | \(R_1=\dots=R_N\) | أسطول مستودع، قافلة شاحنات، رسم خرائط بالطائرات المسيّرة، تجميع بأذرع متعدّدة | VDN، QMIX، MAPPO، COMA |
| تنافسي بالكامل | صفري المجموع \(\sum_i R_i = 0\) | السباقات الذاتية القيادة، المطاردة–المراوغة، الاختبار العدائي | Minimax-Q، اللعب الذاتي (self-play)، PSRO |
| مختلط / ذو مجموع عام | \(R_i\) اعتباطية | المرور الحقيقي: لكل سائق أهدافه الخاصة، لكن الجميع يريدون تجنّب الاصطدام | MADDPG، و PPO المستقل، وطرائق التفضيل الاجتماعي |
روبوتان يجب أن يتبادلا طرفَي ممر
المختبر 8 · المتعلّمون المستقلون مقابل المركزيينيجب أن يصل الروبوت A (الأزرق المخضرّ) إلى الطرف الأيمن، والروبوت B (الكهرماني) إلى الطرف الأيسر. وهناك جيب عبور واحد. مكافأة الفريق: −1 لكل خطوة، و−5 لكل اصطدام. درِّب كل نوع من المتعلّمين، ثم شاهِد. المستقل: لكل روبوت جدول Q خاص به على الحالة المشتركة، لكنه لا يختار إلا فعله الخاص. المركزي: جدول Q واحد على الأفعال المشتركة (25 هنا، لكنها \(5^N\) في الحالة العامة).
عائلات الخوارزميات التي يجب أن تكون قادرًا على شرحها
تعلَّم قيمة فريق \(Q_{tot}\) لكن فكِّكها إلى منافع خاصة بكل وكيل \(Q_i(\tau_i,a_i)\)، بحيث يستطيع كل وكيل أن يتصرّف بجشع بمفرده ويظل يختار أفضل فعل مشترك للفريق. ويُسمّى هذا الشرط مبدأ IGM (Individual-Global-Max، التطابق بين القيمة العظمى الفردية والشاملة):
- VDN (Sunehag et al., 2018): \(Q_{tot}=\sum_i Q_i\). بسيط، لكنه لا يستطيع تمثيل سوى قيم الفريق الجمعية.
- QMIX (Rashid et al., 2018): \(Q_{tot}=f_{mix}(Q_1,\dots,Q_N; s)\) مع \(\frac{\partial Q_{tot}}{\partial Q_i}\ge 0\). والرتابة (monotonicity) شرط كافٍ لتحقيق IGM. تُولَّد أوزان الخالط من الحالة الشاملة بواسطة الشبكات الفائقة (hypernetworks) وتُبقى غير سالبة (بأخذ القيمة المطلقة)، بحيث تستطيع الحالة تشكيل عملية الخلط مع بقاء الرتابة قائمة.
- QTRAN و QPLEX و Weighted QMIX: تُرخي شرط الرتابة لتمثيل تنسيق أغنى (غير رتيب) مع الحفاظ على IGM.
لماذا يفرض QMIX أوزان خلط غير سالبة
المختبر 9 · اتساق IGMيختار كل من الروبوتين الفعل 0 أو 1. اضبط منافعهما الفردية وأوزان الخلط (خالط خطي \(Q_{tot}=w_1Q_1+w_2Q_2\)؛ و VDN هو \(w_1=w_2=1\)). الخلية المظلّلة: أفضل فعل مشترك للفريق. الخلية المتقطّعة: ما يختاره كل روبوت بالنظر إلى \(Q_i\) الخاص به فقط. اجعل أحد الأوزان سالبًا وراقبهما يختلفان.
MADDPG (Lowe et al., 2017): لكل وكيل فاعل حتمي \(\mu_i(o_i)\) وناقد مركزي \(Q_i(\mathbf{x}, a_1,\dots,a_N)\) يرى أرصاد الجميع وأفعالهم. يعمل في الإعدادات التعاونية والتنافسية والمختلطة، ويتعامل مع التحكم المتصل كالتوجيه.
COMA (Foerster et al., 2018) يستهدف إسناد الفضل. فهو يسأل: «بكم كان فعلي أفضل مما كنت سأفعله عادةً، مع تثبيت أفعال الجميع الآخرين؟»، مستخدمًا خط أساس مضادًّا للواقع (counterfactual baseline):
MAPPO (Yu et al., 2022, "The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games"): فاعلو PPO مع مشاركة المعاملات، إضافةً إلى دالة قيمة مركزية \(V_\phi(s)\). يضاهي الطرائق الأعقد أو يتفوّق عليها في SMAC و MPE و Google Research Football، وهو خط الأساس القوي الافتراضي في MARL للروبوتات. أمّا HAPPO/HATRPO (Kuba et al., 2022) فتحدّث الوكلاء تتابعيًا وتأتي بضمان تحسّن رتيب للوكلاء غير المتجانسين.
# MAPPO: الحلقة التي ينبغي أن تستطيع رسمها على السبّورة for iteration in range(K): for t in range(T): # جمع المسارات في محاكاة متوازية a_i, logp_i = actor_θ(o_i) for each agent i # أوزان مشتركة + معرّف الوكيل s', o', r, done = env.step(a_1..a_N) buffer.add(o_i, a_i, logp_i, s, r, done) A_i = GAE(r, V_φ(s), γ, λ) # الناقد المركزي يرى الحالة الشاملة for epoch in range(E): θ ← θ + ∇ L_CLIP(θ; A_i) # قصّ PPO لكل عيّنة وكيل φ ← φ − ∇ (V_φ(s) − R̂)² # النشر: لا يعمل على كل روبوت سوى actor_θ(o_i)
- مشاركة المعاملات (Parameter sharing): شبكة واحدة لجميع الوكلاء المتجانسين، مع معرّف الوكيل ضمن المُدخل. كفؤة في استخدام العيّنات، وهي الخيار المعياري للأساطيل.
- MARL بالحقل المتوسط (Mean-field MARL) (Yang et al., 2018): تقريب الآخرين بـمتوسط أفعالهم، \(Q_i(s,a_i,\bar a_{-i})\). يتوسّع هذا إلى مئات الوكلاء (مرور كثيف، أسراب).
- الشبكات العصبية البيانية / الانتباه (attention): الوكلاء عُقد، والجيران ضمن مدى الاستشعار حواف. تتعامل مع عدد متغيّر من السيارات، وهي لا متغيّرة تحت التباديل (permutation-invariant).
- التواصل المُتعلَّم (Learned communication): CommNet (Sukhbaatar et al., 2016)، و DIAL (Foerster et al., 2016)، و TarMAC (Das et al., 2019، رسائل انتباه موجَّهة). وهي النظير لاتصال V2V.
| الخوارزمية | العائلة | مُدخل الناقد / الخالط | الأفعال | المكافآت | استخدمها حين |
|---|---|---|---|---|---|
| IQL / IPPO | مستقلة | محلي | متقطّعة / كلاهما | أي نوع | خط أساس، و N ضخم جدًا |
| VDN | تفكيك القيمة | مجموع \(Q_i\) | متقطّعة | مشتركة | مهام تعاونية بسيطة |
| QMIX | تفكيك القيمة | خلط رتيب + \(s\) | متقطّعة | مشتركة | تعاون مع تنسيق يعتمد على الحالة |
| COMA | فاعل–ناقد | \(Q(s,\mathbf a)\) مضادّ للواقع | متقطّعة | مشتركة | حين يكون إسناد الفضل مهمًا |
| MADDPG | فاعل–ناقد | \(Q_i(\mathbf x,\mathbf a)\) | متصلة | أي نوع | دوافع مختلطة، وتحكم متصل |
| MAPPO | فاعل–ناقد | \(V(s)\) | كلاهما | مشتركة (غالبًا) | خط الأساس القوي الافتراضي |
| Mean-field Q/AC | تقريب | \(\bar a\) للجيران | متقطّعة | أي نوع | أعداد كبيرة جدًا من الوكلاء المتشابهين |
MARL للروبوتات والسيارات ذاتية القيادة
هكذا تبدو شريحة قوية في حلقة بحثية بعنوان «كيف سأصوغ المسألة». السيناريو: N مركبة ذاتية القيادة متصلة (AVs) تتفاوض على عبور تقاطع بلا إشارات وسط حركة مرور يقودها بشر.
| المكوّن | الاختيار | السبب |
|---|---|---|
| النموذج | Dec-POMDP (تعاوني بين المركبات الذاتية)، والبشر جزء من البيئة ← استقلالية مختلطة (mixed autonomy) | تتشارك المركبات الذاتية هدفًا واحدًا للأسطول؛ أمّا البشر فغير خاضعين للتحكم |
| الرصد \(o_i\) | سرعة المركبة الذاتية، واتجاهها، ومسارها، والمسافة إلى نقطة التعارض؛ والوضعية والسرعة النسبيتان لأقرب k=5 مركبات؛ ونيّة المسار؛ ورسائل V2V اختيارية | حجم ثابت يناسب الشبكات متعددة الطبقات (MLPs)؛ استخدم GNN أو الانتباه لقيمة k متغيّرة |
| الفعل \(a_i\) | تسارع متصل \(\in[-4,2]\ \text{m/s}^2\) على طول مسار مخطَّط، أو متقطّع {إفساح، زحف، انطلاق} | بنية هرمية: يقرّر RL السلوك، ويتتبّعه متحكّم كلاسيكي (MPC/PID)، وهذا أكثر أمانًا وأسهل نقلًا |
| المكافأة \(r\) | \(w_1\,\text{progress} - w_2\,\mathbb{1}[\text{collision}] - w_3\,|\text{jerk}| - w_4\,\mathbb{1}[\text{TTC}<\tau]\) | الكفاءة والسلامة والراحة. احذر من التحايل على المكافأة (reward hacking) (مثل عدم دخول التقاطع أبدًا) |
| الخوارزمية | MAPPO مع مشاركة المعاملات + ناقد مركزي على الحالة الشاملة | مستقرة، وقابلة للتوسّع، وقابلة للنشر وفق CTDE |
| طبقة السلامة | MDP مقيَّدة (Lagrangian PPO) أو درع سلامة (safety shield) / مرشّح بدوال حاجز التحكم (control-barrier-function) على الأفعال | عقوبات المكافأة وحدها لا تضمن السلامة |
| المقاييس | معدّل النجاح، ومعدّل الاصطدام، ومتوسط زمن الرحلة، والإنتاجية (throughput)، والارتجاج (jerk)، والتعميم على كثافات مرور غير مرئية | أبلِغ عن المتوسط ± الانحراف المعياري على ≥ 5 بذور (seeds) |
- الاندماج في الطرق السريعة وتغيير المسار: التفاوض مع المركبات التعاونية والمركبات التي يقودها بشر. صاغ Shalev-Shwartz et al. (2016) القيادة الآمنة متعددة الوكلاء بوصفها RL مع قيود سلامة صارمة.
- التقاطعات والدوّارات: تنسيق بلا إشارات؛ وكذلك التحكم في إشارات المرور، حيث تكون كل إشارة وكيلًا.
- تسيير القوافل (Platooning) / مثبّت السرعة التكيّفي التعاوني: استقرار السلسلة (string stability)، وتوفير الوقود.
- الاستقلالية المختلطة: عدد قليل من المركبات الذاتية يخفّف موجات التوقّف والانطلاق لصالح حركة المرور البشرية (Wu et al.، إطار Flow على SUMO).
- القيادة الاجتماعية: التوجّه نحو القيمة الاجتماعية (Social Value Orientation)، أي تقدير مدى أنانية السائقين الآخرين أو إيثارهم (Schwarting et al., PNAS 2019).
- ملاحة الروبوتات المتعددة: تجنّب الاصطدام اللامركزي انطلاقًا من بيانات LiDAR الخام باستخدام PPO وسياسة مشتركة (Long et al., ICRA 2018)؛ وأساطيل المستودعات؛ وتغطية المناطق بطائرات مسيّرة متعددة؛ والمعالجة بأذرع متعددة.
| الأداة | ما هي |
|---|---|
| SMARTS (Huawei, 2020) | محاكاة قيادة متعددة الوكلاء مصمَّمة لـ MARL، بسيناريوهات تفاعل واقعية |
| MetaDrive | مشاهد قيادة خفيفة مولَّدة إجرائيًا، مع خرائط متعددة الوكلاء (دوّار، تقاطع، عنق زجاجة، موقف سيارات) |
| highway-env | بيئات ثنائية الأبعاد بسيطة للطريق السريع/الاندماج/التقاطع، بواجهة Gymnasium البرمجية، ممتازة للنماذج الأولية السريعة |
| CARLA / SUMO + Flow | محاكاة ثلاثية الأبعاد عالية الدقة / محاكاة مرورية مجهرية للاستقلالية المختلطة |
| VMAS، MPE، PettingZoo | محاكيات متّجهة للروبوتات المتعددة (VMAS، دفعات على وحدة المعالجة الرسومية GPU)؛ وبيئات الجسيمات؛ وواجهة برمجية معيارية متعددة الوكلاء |
| SMAC / SMACv2 | الإدارة الدقيقة للوحدات في StarCraft: المعيار المرجعي القياسي لـ MARL التعاوني (ليس في الروبوتات، لكن المحكّمين يتوقّعونه) |
| المكتبات | EPyMARL، و BenchMARL (TorchRL)، و MARLlib، و RLlib multi-agent |
- السلامة المضمونة: MARL المقيَّد، والتدريع (shielding)، ودوال حاجز التحكم (CBFs) في الإعدادات متعددة الوكلاء؛ والتحقّق من السياسات المتعلَّمة.
- من المحاكاة إلى الواقع (Sim-to-real): التعشية النطاقية (domain randomisation)، وتعرّف الأنظمة (system identification)، والمتانة أمام ضوضاء الحسّاسات والتأخير. والفجوة أكبر في حالة تعدّد الوكلاء، لأن سلوك الوكلاء الآخرين يتغيّر أيضًا.
- التفاعل مع البشر: نمذجة السائقين البشريين غير المتجانسين، والتنسيق دون تدريب مسبق (zero-shot coordination) / العمل الجماعي الارتجالي (ad hoc teamwork) مع شركاء مجهولين.
- قابلية التوسّع و N المتغيّر: سياسات بيانية/قائمة على الانتباه تعمّم من 5 سيارات في التدريب إلى 50 في الاختبار.
- التواصل تحت القيود: عرض النطاق، والتأخير، وانقطاع الاتصال في V2V؛ وماذا ينبغي أن يُتواصَل بشأنه.
- المتانة والخصوم: وكلاء عدائيون لاختبار أنظمة المركبات الذاتية تحت الضغط (استخدام تنافسي لـ MARL).
- MARL غير المتصل (Offline MARL): التعلّم من بيانات الأسطول المسجَّلة دون استكشاف مباشر محفوف بالمخاطر.
- التقييم: البذور، وتنوّع السيناريوهات، والمقاييس المعيارية. يعاني هذا المجال مشكلات حقيقية في قابلية إعادة إنتاج النتائج.
عدّة الحلقة البحثية: ورقة مراجعة سريعة، وأسئلة صعبة، واختبار ذاتي
- الدافع: القيادة متعددة الوكلاء بطبيعتها؛ والتعلّم المعزَّز لوكيل واحد يعامل السيارات الأخرى كضوضاء.
- الصياغة الشكلية: MDP ← لعبة ماركوف ← Dec-POMDP (شريحة واحدة، ثلاث صفوف مرتّبة (tuples)).
- لماذا هو صعب: عدم الثبات، وإسناد الفضل، و \(|\mathcal A|^N\)، وقابلية الرصد الجزئية.
- CTDE والعائلات الرئيسية: تفكيك القيمة (QMIX، IGM) مقابل النقّاد المركزيين (MAPPO، MADDPG).
- التطبيق: جدول صياغة التقاطع من الفصل 10.
- المسائل المفتوحة وزاويتك البحثية: السلامة، ومن المحاكاة إلى الواقع، والتفاعل مع البشر، وقابلية التوسّع.
| الفكرة | المعادلة |
|---|---|
| العائد | \(G_t=\sum_k\gamma^k r_{t+k+1}=r_{t+1}+\gamma G_{t+1}\) |
| أمثلية بلمان | \(Q^*(s,a)=\mathbb E[r+\gamma\max_{a'}Q^*(s',a')]\) |
| MC / TD | \(V\leftarrow V+\alpha(G-V)\) · \(V\leftarrow V+\alpha(r+\gamma V'-V)\) |
| تعلّم Q | \(Q\leftarrow Q+\alpha(r+\gamma\max_{a'}Q'-Q)\) |
| تدرّج السياسة | \(\nabla J=\mathbb E[\nabla\log\pi(a\mid s)A(s,a)]\) |
| PPO | \(\min(\rho\hat A,\ \mathrm{clip}(\rho,1\pm\epsilon)\hat A)\) |
| ناش | \(V_i(\pi_i^*,\pi_{-i}^*)\ge V_i(\pi_i,\pi_{-i}^*)\ \forall i,\pi_i\) |
| IGM / QMIX | \(\arg\max_{\mathbf a}Q_{tot}=(\arg\max_{a_i}Q_i)_i\) · \(\partial Q_{tot}/\partial Q_i\ge0\) |
| خط أساس COMA | \(Q(s,\mathbf a)-\sum_{a_i'}\pi_i(a_i')Q(s,(\mathbf a_{-i},a_i'))\) |
«لماذا لا ندرّب ببساطة سيارة واحدة بتعلّم معزَّز لوكيل واحد ونعامل الآخرين كجزء من البيئة؟»
هذا هو التعلّم المستقل. وهو ينجح حين يكون سلوك الآخرين ثابتًا (حركة مرور مبرمجة مسبقًا). أمّا حين يتكيّفون، فإن ديناميكيات الانتقال التي تراها كل سيارة تصبح غير ثابتة: \(P(s'\mid s,a_i)=\sum_{\mathbf a_{-i}}\boldsymbol\pi_{-i}(\mathbf a_{-i}\mid s)P(s'\mid s,a_i,\mathbf a_{-i})\) تتغيّر بتغيّر \(\boldsymbol\pi_{-i}\). فلا يعود برهان تقارب تعلّم Q منطبقًا، وتحصل على تذبذب أو سوء تنسيق (المختبر 8). كما أنه يتجاهل فرص التنسيق مثل الاندماج التعاوني.
«هل يفترض CTDE وجود تواصل وقت الاختبار؟»
لا، وهذا بيت القصيد. لا يعمل على المركبة سوى الفاعلين اللامركزيين، مستخدمين الأرصاد المحلية. أمّا المعلومات المركزية فلا تُستخدم إلا في التدريب، داخل الناقد أو الخالط، الذي يُستغنى عنه عند النشر. وإن وُجد اتصال V2V فيمكنك إضافته كجزء من \(o_i\) أو كتواصل متعلَّم.
«ما قيود QMIX؟»
الرتابة شرط كافٍ لكنه غير لازم لتحقيق IGM، ولذلك لا يستطيع QMIX تمثيل القيم المشتركة التي يعتمد فيها أفضل فعل لوكيل ما على أفعال الآخرين اعتمادًا غير رتيب (مثل «انطلق فقط إن أفسح الآخر الطريق، وإلا انقلب العائد»). وتعالج QTRAN و QPLEX و Weighted QMIX هذه المسألة. كما أنه مقتصر على الأفعال المتقطّعة والإعدادات التعاونية.
«كيف تتعامل مع السلامة؟ فالتعلّم المعزَّز قد يتسبّب في حوادث.»
على طبقات: (1) صياغة CMDP، أي تعظيم المكافأة بشرط \(\mathbb E[\sum\gamma^t c_t]\le d\)، وتُحل بطرائق لاغرانج؛ (2) درع وقت التشغيل أو مرشّح بدوال حاجز التحكم يتجاوز الأفعال غير الآمنة؛ (3) تصميم هرمي يختار فيه RL السلوكيات وينفّذها متحكّم منخفض المستوى مُتحقَّق منه؛ (4) اختبار عدائي وقائم على السيناريوهات. عقوبات المكافأة وحدها لا تمنح أي ضمان.
«لماذا يعمل MAPPO بهذه الجودة مع أنه "مجرد PPO"؟»
حدّد Yu et al. تفاصيل تنفيذية مؤثّرة: تطبيع القيمة، ومُدخل حالة شاملة للناقد مع خصائص خاصة بكل وكيل، ومشاركة المعاملات، وعدد قليل من حقب PPO، وقيمة قصّ ε صغيرة للحدّ من عدم الثبات الناتج عن التحديثات المتزامنة. وتحدّ منطقة الثقة ضمنيًا من سرعة انجراف سياسات الوكلاء الآخرين.
«كيف تقيّم التعميم؟»
درِّب واختبر على كثافات مرور وهندسات طرق ونماذج سائقين بشريين مختلفة؛ غيِّر N؛ أبلِغ عن معدّلات النجاح والاصطدام مع فترات ثقة على عدة بذور؛ وأدرِج خطوط أساس قائمة على القواعد (IDM + MOBIL للطرق السريعة) وخطوط أساس بتعلّم معزَّز لوكيل واحد.
«ما الفرق بين لعبة ماركوف و Dec-POMDP؟»
تمنح لعبة ماركوف كل وكيل مكافأته الخاصة و(عادةً) رصدًا كاملًا للحالة؛ وهي تغطّي الإعدادات التنافسية والمختلطة. أمّا Dec-POMDP فتعاونية (مكافأة واحدة مشتركة) وجزئية الرصد (لكل وكيل دالة رصد خاصة به). وتعمّم POSG (اللعبة العشوائية جزئية الرصد) كلتيهما.
النتيجة: 0 / 0
مراجع موصى بها: Sutton & Barto, Reinforcement Learning: An Introduction (التعلّم المعزَّز: مقدّمة؛ الطبعة الثانية، متاح مجانًا على الإنترنت)؛ Albrecht, Christianos & Schäfer, Multi-Agent Reinforcement Learning: Foundations and Modern Approaches (التعلّم المعزَّز متعدد الوكلاء: الأسس والمقاربات الحديثة؛ MIT Press, 2024، ملف PDF مجاني)؛ Zhang, Yang & Başar, "Multi-Agent RL: A Selective Overview of Theories and Algorithms" (2021).