النطاق masaqat.com معروض للبيع. قدّم عرضك →
من روبوت واحد إلى طريق بأكمله · مسار دراسي لحلقة نقاش دكتوراه

التعلم المعزز متعدد الوكلاء، بناءً تدريجيًا من روبوت واحد

يسير كل فصل على النهج نفسه: ما يفعله المفهوم عمليًا، ثم الآليات التقنية، ثم النظرية والمعادلات. في كل فصل مختبر تفاعلي يمكنك التحكم فيه بنفسك. لا يحتاج أي شيء هنا في البداية إلى أكثر من جبر المرحلة الثانوية والاحتمالات وقليل من التفاضل والتكامل. وبنهاية الدليل ستكون قد بلغت مستوى البحث العلمي.

~45 دقيقة · الفصول 1–5أساسيات التعلم المعزز أحادي الوكيلعمليات قرار ماركوف، العوائد، معادلة بلمان، مونت كارلو، TD، Q-learning
~50 دقيقة · الفصول 6–9التعلم المعزز العميق ← MARLPPO، ألعاب ماركوف، Dec-POMDPs، CTDE، QMIX، MAPPO، MADDPG
~30 دقيقة · الفصول 10–11الروبوتات والسيارات وعرضك التقديميصياغات المركبات الذاتية والروبوتات، المسائل المفتوحة، الأسئلة المتوقعة، اختبار قصير
الفصل 1الأسس

حلقة الوكيل–البيئة

عمليًا

تخيّل روبوتًا في مستودع. عشر مرات في الثانية يقرأ حساساته، ويختار أمرًا للمحركات، فيستجيب العالم: يتحرك، وربما يصطدم برفّ، وربما يصل إلى نقطة الالتقاط. لا أحد يخبره بالأمر الصحيح. كل ما يحصل عليه رقم، هو المكافأة (reward)، يخبره بمدى جودة تلك اللحظة. والتعلم المعزز (Reinforcement Learning, RL) هو هندسة تحويل هذه الأرقام إلى سلوك جيد.

# الحلقة التي تنفّذها كل مكتبة للتعلم المعزز (واجهة Gymnasium البرمجية)
obs, info = env.reset()
for t in range(T):
    action = policy(obs)                       # الوكيل يقرّر
    obs, reward, terminated, truncated, info = env.step(action)  # العالم يستجيب
    if terminated or truncated:
        break
المصطلحات التقنية
المصطلحالرمزروبوت المستودعالسيارة ذاتية القيادة
الحالة (State)\(s_t\)الوضعية، البطارية، خريطة الرفوفوضعية المركبة الذاتية وسرعتها، جميع المركبات القريبة، الإشارات الضوئية
الملاحظة (Observation)\(o_t\)مسح LiDAR، قياس دوران العجلات (odometry)كاميرا + LiDAR + رادار، أي ما تراه الحساسات فعلًا
الفعل (Action)\(a_t\){أمام، يسار، يمين، توقف}زاوية التوجيه، التسارع (مستمر)
المكافأة (Reward)\(r_{t+1}\)+10 عند الالتقاط، −1 لكل ثانية+التقدّم، −الاصطدام، −الارتجاج (jerk)
السياسة (Policy)\(\pi(a\mid s)\)المتحكم الذي نتعلّمه: دالة تربط الموقف بالأفعال (أو بتوزيع احتمالي عليها)
الحلقة (Episode)رحلة توصيل واحدةعبور واحد لتقاطع طرق

قُد الروبوت بنفسك

المختبر 1 · أنت السياسة

استخدم لوحة الأزرار أو مفاتيح الأسهم (انقر على المختبر أولًا). اوصل إلى الهدف الأخضر (+10)؛ الخلايا الحمراء حُفَر (−10)؛ وكل خطوة تكلّف −1. فعّل الأرضية الزلقة فتنحرف أوامرك أحيانًا إلى الجانب. هذه العشوائية هي احتمال الانتقال \(P\) الذي ستتعرّف عليه في الفصل 3.

اختبر نفسك: لماذا تُعدّ صورة الكاميرا ملاحظة وليست الحالة؟
الفصل 2الأسس

العائد والخصم: ما الذي يعظّمه الوكيل فعلًا

عمليًا

السيارة التي لا تعظّم إلا مكافأة هذه الثانية ستضغط دواسة الوقود حتى آخرها نحو طابور من السيارات. نريدها أن تهتم بالرحلة كلها، لكن أن تهتم أقل قليلًا بالمستقبل البعيد، فهو غير مؤكد على أي حال. نحقق ذلك بواسطة معامل الخصم (discount factor) \(\gamma\in[0,1)\).

تقنيًا

العائد (return) ابتداءً من الزمن \(t\) هو المجموع المخصوم للمكافآت (rewards) المستقبلية:

\[ G_t = r_{t+1} + \gamma r_{t+2} + \gamma^2 r_{t+3} + \dots = \sum_{k=0}^{\infty} \gamma^k\, r_{t+k+1} \]

وهو يحقق علاقة تكرارية يُبنى عليها بقية التعلم المعزز (RL):

\[ G_t = r_{t+1} + \gamma\, G_{t+1} \]
النظرية

إذا كانت المكافآت محدودة، \(|r|\le R_{\max}\)، فإن المتسلسلة الهندسية تعطي \(|G_t|\le R_{\max}/(1-\gamma)\)، أي أن المجموع منتهٍ. والأفق الفعلي (effective horizon) يساوي تقريبًا \(1/(1-\gamma)\) خطوة. قاعدة تقريبية للروبوتات: الأفق بالثواني ≈ \(\frac{1}{1-\gamma}\cdot \Delta t\). اختر \(\gamma\) بناءً على تردد التحكم وعلى المدى الذي تتطلب المهمة أن تنظر إليه مسبقًا. لا تختره عشوائيًا.

إلى أي مدى تنظر سيارتك إلى الأمام؟

المختبر 2 · أوزان الخصم

تُظهر الأعمدة الوزن \(\gamma^k\) المعطى لمكافأة تقع على بُعد \(k\) خطوة. حرّك γ ومعدل التحكم، واقرأ أفق التخطيط الناتج.

الفصل 3جوهر التعلم المعزز

عمليات قرار ماركوف ومعادلة بلمان

عمليًا

لكي نفكر في الروبوت رياضيًا، نصف عالمه بخمسة مكوّنات: ما المواقف الموجودة، وما الأفعال المتاحة، وكيف تغيّر الأفعال المواقف (مع وجود ضوضاء)، وما قيمة كل نتيجة، وبأي قدر نخصم المستقبل. هذه الحزمة هي عملية قرار ماركوف (MDP).

التعريف التقني
\[ \mathcal{M} = (\mathcal{S}, \mathcal{A}, P, R, \gamma),\qquad P(s'\mid s,a) = \Pr(s_{t+1}=s' \mid s_t=s, a_t=a) \]

خاصية ماركوف (Markov property): يعتمد المستقبل على الحالة الحاضرة فقط، لا على الطريقة التي وصلت بها إليها: \(\Pr(s_{t+1}\mid s_t,a_t) = \Pr(s_{t+1}\mid s_0,a_0,\dots,s_t,a_t)\). بالنسبة للسيارة، الموقع والسرعة معًا يحققان خاصية ماركوف؛ أما الموقع وحده فلا.

تقيس دالتا قيمة (value functions) مدى جودة الأمور تحت سياسة (policy) \(\pi\):

\[ V^\pi(s) = \mathbb{E}_\pi\left[G_t \mid s_t = s\right], \qquad Q^\pi(s,a) = \mathbb{E}_\pi\left[G_t \mid s_t=s, a_t=a\right] \]

تجيب \(V\) عن سؤال "ما مدى جودة أن أكون هنا؟"، وتجيب \(Q\) عن سؤال "ما مدى جودة أن أفعل هذا هنا؟". وبمجرد معرفة \(Q\) يصبح التصرف سهلًا: اختر \(\arg\max_a Q(s,a)\).

النظرية: معادلات بلمان

عوّض \(G_t = r_{t+1}+\gamma G_{t+1}\) في التعريف وخذ القيم المتوقعة. ستحصل على شرط اتساق لخطوة واحدة:

\[ V^\pi(s) = \sum_a \pi(a\mid s) \sum_{s'} P(s'\mid s,a)\big[R(s,a,s') + \gamma V^\pi(s')\big] \]

أما القيمة المثلى فتستبدل "المتوسط على السياسة" بـ"اختيار أفضل فعل":

\[ V^*(s) = \max_a \sum_{s'} P(s'\mid s,a)\big[R(s,a,s') + \gamma V^*(s')\big], \qquad Q^*(s,a) = \sum_{s'}P(s'\mid s,a)\big[R + \gamma \max_{a'} Q^*(s',a')\big] \]

عرّف مؤثر أمثلية بلمان (Bellman optimality operator) \(\mathcal{T}\) على أنه الطرف الأيمن. إنه \(\gamma\)-انكماش (contraction) بالنسبة لمعيار القيمة العظمى (max-norm): \(\|\mathcal{T}V - \mathcal{T}U\|_\infty \le \gamma \|V-U\|_\infty\). وبحسب مبرهنة باناخ للنقطة الثابتة (Banach fixed-point theorem) له نقطة ثابتة واحدة بالضبط هي \(V^*\)، وتطبيقه بشكل متكرر (تكرار القيمة (value iteration)) يتقارب من أي نقطة بداية. كل مسح يقلّص الخطأ بمعامل \(\gamma\) على الأقل.

شاهد القيمة تنتشر إلى الخلف انطلاقًا من الهدف

المختبر 3 · تكرار القيمة

اضغط مسح واحد وشاهد القيمة تنتشر إلى الخارج من الهدف. تُظهر الأسهم السياسة الجشعة (greedy policy). انقر على خلية لترى حساب تحديث بلمان (Bellman backup) الخاص بها مفصّلًا. انتقل إلى تحرير الخريطة وانقر على الخلايا للتنقل بين فارغة ← جدار ← حفرة، ثم لاحظ كيف تعيد السياسة رسم المسار. ارفع احتمال الانزلاق فيبدأ الروبوت بالابتعاد عن الحُفَر.

اختبر نفسك: يحتاج تكرار القيمة إلى \(P\) و\(R\). فماذا لو لم يكن لدينا نموذج للعالم (كحركة المرور الحقيقية)؟
الفصل 4جوهر التعلم المعزز

التعلم من التجربة: مونت كارلو والفرق الزمني

عمليًا

مونت كارلو (Monte Carlo, MC): قُد المسار كاملًا، وسجّل إجمالي المكافأة، واحسب متوسطه على رحلات كثيرة. الفرق الزمني (Temporal Difference, TD): بعد كل خطوة منفردة، حدّث تقديرك باستخدام المكافأة التي حصلت عليها للتو مضافًا إليها تقديرك الحالي للمكان الذي وصلت إليه. يتعلم TD أثناء القيادة ولا يحتاج إلى انتهاء الرحلة.

قواعد التحديث التقنية
\[ \text{MC:}\quad V(s_t) \leftarrow V(s_t) + \alpha\big[\,G_t - V(s_t)\,\big] \]
\[ \text{TD(0):}\quad V(s_t) \leftarrow V(s_t) + \alpha\big[\,\underbrace{r_{t+1} + \gamma V(s_{t+1})}_{\text{TD target}} - V(s_t)\,\big],\qquad \delta_t = r_{t+1}+\gamma V(s_{t+1}) - V(s_t) \]

كلتاهما تعني "حرّك التقدير بنسبة \(\alpha\) نحو هدف ما". والفرق بينهما هو الهدف.

النظرية: الانحياز مقابل التباين
مونت كارلوTD(0)
الهدف\(G_t\): عائد حقيقي مأخوذ من عينة\(r+\gamma V(s')\): يستخدم تقديره الخاص (التمهيد الذاتي (bootstrapping))
الانحياز (Bias)غير منحاز: \(\mathbb{E}[G_t]=V^\pi(s_t)\)منحاز ما دامت \(V\) خاطئة
التباين (Variance)مرتفع: يجمع مكافآت عشوائية كثيرةمنخفض: مكافأة عشوائية واحدة وانتقال واحد
يحتاج إلى نهاية الحلقة؟نعملا، يتعلم أثناء التشغيل (online)
افتراض ماركوفغير مطلوبيستثمره (أفضل في العوالم الماركوفية)

وبينهما تقع العوائد متعددة الخطوات (n-step returns) وTD(λ)، اللتان تمزجان أهدافًا بكل الأطوال. وGAE في PPO (الفصل 6) هو هذه الفكرة بعينها مطبّقة على دوال الميزة (advantages). التقارب: يتقارب TD(0) الجدولي إلى \(V^\pi\) في ظل أحجام خطوات روبنز–مونرو (Robbins–Monro) (\(\sum\alpha_t=\infty,\ \sum\alpha_t^2<\infty\)).

MC مقابل TD في مسار عشوائي من 5 حالات

المختبر 4 · المثال الكلاسيكي لساتون وبارتو

يبدأ روبوت من C ويتحرك يسارًا أو يمينًا عشوائيًا. الخروج من اليمين يعطي 1، والخروج من اليسار يعطي 0. القيم الحقيقية هي A=1/6 … E=5/6. شغّل حلقات وقارن سرعة وصول كل مقدِّر إلى القيم الصحيحة. يزيل متوسط 100 تشغيل أثر الحظ ويُظهر منحنى التعلم النموذجي.

الفصل 5جوهر التعلم المعزز

التحكم: Q-learning وSARSA والاستكشاف

عمليًا

تقييم سياسة (policy) ثابتة لا يكفي. نريد للروبوت أن يتحسّن. احتفظ بجدول \(Q(s,a)\)، وتصرّف في الغالب بجشع (greedily)، وجرّب أحيانًا فعلًا عشوائيًا (ε-greedy). إذا لم يجرّب الروبوت المسار غير المألوف أبدًا، فلن يكتشف أبدًا أن ذلك المسار أفضل.

تقنيًا
\[ \text{Q-learning:}\quad Q(s,a) \leftarrow Q(s,a) + \alpha\big[r + \gamma \max_{a'}Q(s',a') - Q(s,a)\big] \]
\[ \text{SARSA:}\quad Q(s,a) \leftarrow Q(s,a) + \alpha\big[r + \gamma\, Q(s',a'_{\text{actually taken}}) - Q(s,a)\big] \]

Q-learning خارج السياسة (off-policy): يتعلم قيمة السياسة الجشعة بينما يتصرف بأسلوب ε-greedy، وذلك بفضل \(\max\). أما SARSA فهو ضمن السياسة (on-policy): يتعلم قيمة ما يفعله فعلًا، بما في ذلك الاستكشاف، ولذلك يتعلم مسارات أكثر أمانًا بالقرب من المنحدرات والحُفَر. هذا التمييز يتكرر كثيرًا في النقاشات المتعلقة بسلامة الروبوتات.

النظرية

يتقارب Q-learning الجدولي إلى \(Q^*\) باحتمال 1 (Watkins & Dayan, 1992) إذا زِير كل زوج حالة–فعل عددًا لانهائيًا من المرات وحققت أحجام الخطوات شروط روبنز–مونرو. إنه تقريب عشوائي (stochastic approximation) للنقطة الثابتة لمعادلة أمثلية بلمان من الفصل 3. تذكّر هذا جيدًا: يفترض البرهان بيئة ثابتة (stationary). وفي MARL يكون الوكلاء المتعلمون الآخرون جزءًا من البيئة، فينهار هذا الافتراض. وهذه هي المشكلة الجذرية في الفصل 7.

درّب روبوتًا باستخدام Q-learning

المختبر 5 · Q-learning الجدولي

درّب على دفعات وشاهد الأسهم الجشعة تستقر. جرّب ε = 0: كثيرًا ما يعلق الروبوت في أول مسار متوسط الجودة يجده. ثم اضغط شاهد تشغيلًا جشعًا.

الفصل 6التعلّم المعزَّز العميق

التعلّم المعزَّز العميق (Deep RL): ‏DQN، وتدرّجات السياسة، والفاعل–الناقد، و PPO

من الناحية العملية

حالة السيارة متصلة وعالية الأبعاد، فلا يمكن لأي جدول أن يستوعبها. لذا نستبدل الجدول بشبكة عصبية، \(Q_\theta(s,a)\) أو \(\pi_\theta(a\mid s)\). والتوجيه ودوّاسة الوقود متغيّران متصلان، مما يجعل «أخذ القيمة العظمى على الأفعال» أمرًا مُربكًا، ولذلك كثيرًا ما نتعلّم السياسة مباشرةً.

تقنيًا: الطرائق القائمة على القيمة (DQN)
\[ \mathcal{L}(\theta) = \mathbb{E}_{(s,a,r,s')\sim\mathcal{D}}\Big[\big(r + \gamma \max_{a'} Q_{\bar\theta}(s',a') - Q_\theta(s,a)\big)^2\Big] \]

ثمة عاملا تثبيت. مخزن إعادة التشغيل (replay buffer) \(\mathcal{D}\) يكسر الارتباط بين العيّنات المتتالية. والشبكة الهدف (target network) \(\bar\theta\)، وهي نسخة تُحدَّث ببطء، تمنع الهدف من ملاحقة نفسه. ويعالج Double DQN مشكلة المبالغة في التقدير الناتجة عن أخذ القيمة العظمى. أمّا عدم الاستقرار فمصدره الثالوث القاتل (deadly triad): تقريب الدوال + التمهيد الذاتي (bootstrapping) + البيانات خارج السياسة (off-policy).

تقنيًا: تدرّج السياسة (policy gradient)

نعظّم \(J(\theta)=\mathbb{E}_{\pi_\theta}[G_0]\) مباشرةً. وتنصّ مبرهنة تدرّج السياسة (Sutton et al., 2000) على ما يلي:

\[ \nabla_\theta J(\theta) = \mathbb{E}_{\pi_\theta}\big[\nabla_\theta \log \pi_\theta(a_t\mid s_t)\; A^{\pi}(s_t,a_t)\big],\qquad A^\pi(s,a)=Q^\pi(s,a)-V^\pi(s) \]

بعبارة أخرى: اجعل الأفعال التي تبيّن أنها أفضل من المتوسط (\(A>0\)) أكثر احتمالًا. تستخدم خوارزمية REINFORCE القيمة \(G_t\) بدلًا من \(A\)، وهي فكرة مونت كارلو (MC) وتعاني تباينًا مرتفعًا. أمّا الفاعل–الناقد (Actor–critic) فيتعلّم ناقدًا \(V_\phi\) ويستخدم خطأ الفرق الزمني \(\delta_t\) تقديرًا للأفضلية (advantage)، وهي فكرة الفرق الزمني (TD). ويمزج GAE بين الفكرتين: \(\hat A_t=\sum_l (\gamma\lambda)^l \delta_{t+l}\).

نظريًا: دالة الهدف المقصوصة في PPO

الخطوات الكبيرة في السياسة قد تُفسد الأداء. تحدّ PPO (Schulman et al., 2017) من مدى ابتعاد السياسة الجديدة عن السياسة التي جمعت البيانات، مستخدمةً نسبة الاحتمال \(\rho_t(\theta) = \pi_\theta(a_t\mid s_t)/\pi_{\text{old}}(a_t\mid s_t)\):

\[ L^{\text{CLIP}}(\theta)=\mathbb{E}_t\Big[\min\big(\rho_t\hat A_t,\ \operatorname{clip}(\rho_t,1-\epsilon,1+\epsilon)\hat A_t\big)\Big] \]

إنها تقريب رخيص من الرتبة الأولى لمنطقة الثقة (trust region) في TRPO (قيد KL). وتكتسب PPO أهميتها هنا لأن MAPPO، أقوى خط أساس بسيط في التعلّم المعزَّز متعدد الوكلاء (MARL)، ليست سوى PPO مع ناقد مركزي.

شاهِد ما يفعله القصّ

المختبر 6 · دالة PPO البديلة

الخط المتقطّع: \(\rho\hat A\) دون قصّ. الخط المتصل: دالة هدف PPO. حيثما يصبح الخط المتصل مستويًا يكون التدرّج صفرًا، فلا يجد المُحسِّن سببًا لدفع النسبة أبعد من ذلك.

الخوارزميات الأساسية للتحكم المتصل: DDPG ← TD3 (ناقدان توأمان، وفاعل مؤخَّر التحديث) ← SAC (أقصى إنتروبيا، خارج السياسة، وعالية الكفاءة في استخدام العيّنات). تهيمن PPO المعتمدة على السياسة (on-policy) على المحاكاة المتوازية على نطاق واسع (روبوتات بأرجل على نمط Isaac Gym). وتشيع SAC/TD3 خارج السياسة حين تكون العيّنات مكلفة.

الفصل 7MARL

من وكيل واحد إلى وكلاء متعدّدين: ألعاب ماركوف، و Dec-POMDP، والتوازنات

من الناحية العملية

ضع سيارتين ذاتيتي القيادة عند تقاطع بلا إشارات. ما هو أمثل للسيارة 1 يتوقف الآن على ما تفعله السيارة 2، والسيارة 2 تتعلّم هي الأخرى. فمن وجهة نظر السيارة 1، تظل البيئة تغيّر قواعدها. وأسطول روبوتات المستودعات، وقافلة الشاحنات، وسرب الطائرات المسيّرة، كلها تحمل هذه البنية.

تقنيًا: النماذج

لعبة ماركوف (العشوائية) (Markov/stochastic game) (Shapley 1953; Littman 1994) مع \(N\) وكيلًا:

\[ \mathcal{G}=\big(\mathcal{N}, \mathcal{S}, \{\mathcal{A}_i\}_{i=1}^N, P, \{R_i\}_{i=1}^N, \gamma\big),\quad P(s'\mid s,\mathbf{a}),\ \ \mathbf{a}=(a_1,\dots,a_N)\in \mathcal{A}_1\times\dots\times\mathcal{A}_N \]

تعتمد قيمة كل وكيل على السياسة المشتركة (joint policy) \(\boldsymbol\pi=(\pi_1,\dots,\pi_N)\): \(V_i^{\boldsymbol\pi}(s)=\mathbb{E}_{\boldsymbol\pi}[\sum_k\gamma^k r_{i,t+k+1}\mid s_t=s]\). والروبوتات والسيارات لا ترى إلا محليًا، وفي المهام التعاونية تتشارك مكافأة فريق واحدة، ولذلك فالنموذج المعياري هو Dec-POMDP (عملية ماركوف القرارية اللامركزية جزئية الرصد):

\[ \big(\mathcal{N},\mathcal{S},\{\mathcal{A}_i\},P,R,\{\Omega_i\},O,\gamma\big),\qquad o_i \sim O_i(\cdot\mid s),\qquad \pi_i(a_i\mid \tau_i) \]

هنا \(\tau_i\) هو تاريخ الأفعال–الأرصاد الخاص بالوكيل \(i\). وإيجاد سياسة مثلى لـ Dec-POMDP ذات أفق منتهٍ مسألة NEXP-complete (Bernstein et al., 2002)، وهي أصعب بكثير من MDP لوكيل واحد (P-complete). ولهذا يلجأ MARL العملي إلى التقريبات والتعلّم.

التحديات الجوهرية الخمسة
التحديما الذي يسوءمثال من القيادة / الروبوتاتالعلاج المعتاد
عدم الثبات (Non-stationarity)تتغيّر سياسات الآخرين، فينجرف كلٌّ من \(P\) و \(R\) كما يراهما الوكيل \(i\)، وتسقط براهين التقارب الخاصة بالوكيل الواحدتتعلّم السيارة A أن تكون عدوانية؛ فتتوقف فجأة عادة «إفساح الطريق» لدى السيارة B عن أن تؤتي ثمارهانقّاد مركزيون (CTDE)، ونمذجة الخصم، وتحديثات بطيئة / ضمن منطقة ثقة
إسناد الفضل (Credit assignment)مع مكافأة مشتركة، من الذي تسبّب في النجاح؟توفّر القافلة الوقود: هل الفضل للشاحنة القائدة أم للثالثة؟تفكيك القيمة (VDN/QMIX)، وخطوط أساس مضادّة للواقع (COMA)، ومكافآت الفرق (difference rewards)
انفجار الفعل المشترك (Joint-action explosion)\(|\mathcal{A}|^N\) ينمو أُسّيًا20 روبوتًا × 5 أفعال = \(5^{20}\approx 10^{14}\) فعلًا مشتركًافاعلون لامركزيون، ومشاركة المعاملات، والحقل المتوسط (mean-field)، والشبكات العصبية البيانية (GNNs)
قابلية الرصد الجزئية (Partial observability)حسّاسات محلية فقطأحد المشاة محجوب خلف شاحنةسياسات بشبكات عصبية تكرارية (RNN)، والتواصل، وحالات الاعتقاد (belief states)
اختيار التوازن (Equilibrium selection)توازنات كثيرة، وقد يختار الوكلاء توازنات متعارضةتنتظر السيارتان كلتاهما بأدب إلى الأبد، أو تنطلقان معًاالأعراف (conventions)، والتواصل، والتدريب المركزي
نظريًا: مفاهيم الحل

في الألعاب ذات المجموع العام (general-sum) لا توجد سياسة «مثلى» واحدة. والمفهوم المحوري هو توازن ناش (Nash equilibrium): لا يستطيع أي وكيل أن يحقق نتيجة أفضل بتغيير سياسته وحدها.

\[ V_i^{(\pi_i^*,\,\boldsymbol\pi_{-i}^*)}(s) \;\ge\; V_i^{(\pi_i,\,\boldsymbol\pi_{-i}^*)}(s)\quad \forall i,\ \forall \pi_i,\ \forall s \]

مفاهيم ذات صلة: الاستجابة الفضلى (best response) \(\pi_i\in \arg\max V_i^{(\pi_i,\boldsymbol\pi_{-i})}\)؛ وأمثلية باريتو (Pareto optimality) (لا يمكن لأحد أن يكسب دون أن يخسر غيره)؛ والتوازن المترابط (correlated equilibrium) (إشارة مشتركة، كإشارة المرور، تنسّق بين الوكلاء). يوجد توازن ناش في الاستراتيجيات المختلطة للألعاب المنتهية (Nash 1950)، لكنه قد يكون غير كفء بمعيار باريتو. ويُظهر الإعداد المسبق لمعضلة السجين أدناه ذلك. وللألعاب صفرية المجموع (zero-sum) هناك minimax-Q (Littman 1994)؛ وللألعاب ذات المجموع العام هناك Nash-Q (Hu & Wellman 2003)، التي تحتاج إلى افتراضات قوية كي تتقارب.

سيارتان وتقاطع واحد: ديناميكيات التعلّم في فضاء السياسات

المختبر 7 · نظرية الألعاب تلتقي بالتعلّم

تنفّذ كل سيارة بشكل مستقل صعودًا تدرّجيًا (gradient ascent) على عائدها الخاص. انقر في أي موضع داخل المربّع لتبدأ السيارتين عند تلك الاحتمالات، وراقب إلى أين ينتهي التعلّم المستقل. الخلايا الخضراء في الجدول هي توازنات ناش صافية. العوائد قابلة للتعديل (سيارة الصف أولًا، ثم سيارة العمود).

الفصل 8MARL

كيف ندرّب وكلاء كثيرين: التعلّم المركزي (CL)، والتعلّم اللامركزي (DL)، و CTDE

من الناحية العملية

في المحاكاة يمكنك أن ترى كل شيء: موضع كل سيارة، وكل فعل. أمّا على الطريق الحقيقي فلا تملك كل سيارة سوى حسّاساتها الخاصة، وربما وصلة اتصال بين المركبات (V2V) متقطّعة. والنموذج السائد يستثمر هذا اللاتماثل: درِّب بالمعلومات الشاملة، ونفِّذ بالمعلومات المحلية.

التعلّم المركزي (CL)

«وكيل خارق» واحد يختار الفعل المشترك \(\mathbf a\) انطلاقًا من الحالة الشاملة. يؤول ذلك إلى MDP لوكيل واحد، لكن فضاء الأفعال يصبح \(|\mathcal{A}|^N\)، ويتطلّب تواصلًا تامًّا وقت التشغيل. ونادرًا ما يكون ذلك قابلًا للنشر على السيارات.

التعلّم اللامركزي / المستقل (DL)

يعامل كل وكيل الآخرين كجزء من البيئة: IQL و IPPO. إنه بسيط وقابل للتوسّع، لكنه يفتقر إلى ضمان التقارب بسبب عدم الثبات. ومع ذلك، فإن IPPO خط أساس قوي على نحو مفاجئ (de Witt et al., 2020).

التدريب المركزي مع التنفيذ اللامركزي (CTDE)

يستخدم الفاعلون \(\pi_i(a_i\mid\tau_i)\) الأرصاد المحلية فقط، فهم قابلون للنشر. وأثناء التدريب، يحصل ناقد أو خالط (mixer) على الحالة الشاملة \(s\) وعلى جميع الأفعال \(\mathbf a\). ومن منظور الناقد تعود البيئة ثابتة، لأنه يشترط على ما فعله الآخرون. و MAPPO و MADDPG و COMA و QMIX و VDN كلها من فئة CTDE.

بنية CTDE

مخطط
التنفيذ: على كل مركبة، محليًا فقط الفاعل π₁(a₁ | τ₁)حسّاسات السيارة 1 الفاعل π₂(a₂ | τ₂)حسّاسات السيارة 2 الفاعل πₙ(aₙ | τₙ)حسّاسات السيارة N للتدريب فقط: داخل المحاكي، بمعلومات شاملة ناقد / خالط مركزي V(s) · Q(s, a₁…aₙ) · Q_tot = f(Q₁…Qₙ, s) aᵢ, oᵢ + الحالة الشاملة s التدرّجات
تصنيف بنى المكافأة
الإعدادالمكافأةأمثلةالخوارزميات المعتادة
تعاوني بالكامل\(R_1=\dots=R_N\)أسطول مستودع، قافلة شاحنات، رسم خرائط بالطائرات المسيّرة، تجميع بأذرع متعدّدةVDN، QMIX، MAPPO، COMA
تنافسي بالكاملصفري المجموع \(\sum_i R_i = 0\)السباقات الذاتية القيادة، المطاردة–المراوغة، الاختبار العدائيMinimax-Q، اللعب الذاتي (self-play)، PSRO
مختلط / ذو مجموع عام\(R_i\) اعتباطيةالمرور الحقيقي: لكل سائق أهدافه الخاصة، لكن الجميع يريدون تجنّب الاصطدامMADDPG، و PPO المستقل، وطرائق التفضيل الاجتماعي

روبوتان يجب أن يتبادلا طرفَي ممر

المختبر 8 · المتعلّمون المستقلون مقابل المركزيين

يجب أن يصل الروبوت A (الأزرق المخضرّ) إلى الطرف الأيمن، والروبوت B (الكهرماني) إلى الطرف الأيسر. وهناك جيب عبور واحد. مكافأة الفريق: −1 لكل خطوة، و−5 لكل اصطدام. درِّب كل نوع من المتعلّمين، ثم شاهِد. المستقل: لكل روبوت جدول Q خاص به على الحالة المشتركة، لكنه لا يختار إلا فعله الخاص. المركزي: جدول Q واحد على الأفعال المشتركة (25 هنا، لكنها \(5^N\) في الحالة العامة).

الفصل 9متقدّم

عائلات الخوارزميات التي يجب أن تكون قادرًا على شرحها

1 · تفكيك القيمة (Value decomposition) (تعاوني، أفعال متقطّعة)

تعلَّم قيمة فريق \(Q_{tot}\) لكن فكِّكها إلى منافع خاصة بكل وكيل \(Q_i(\tau_i,a_i)\)، بحيث يستطيع كل وكيل أن يتصرّف بجشع بمفرده ويظل يختار أفضل فعل مشترك للفريق. ويُسمّى هذا الشرط مبدأ IGM (Individual-Global-Max، التطابق بين القيمة العظمى الفردية والشاملة):

\[ \arg\max_{\mathbf a} Q_{tot}(\boldsymbol\tau,\mathbf a) = \Big(\arg\max_{a_1}Q_1(\tau_1,a_1),\ \dots,\ \arg\max_{a_N}Q_N(\tau_N,a_N)\Big) \]
  • VDN (Sunehag et al., 2018): \(Q_{tot}=\sum_i Q_i\). بسيط، لكنه لا يستطيع تمثيل سوى قيم الفريق الجمعية.
  • QMIX (Rashid et al., 2018): \(Q_{tot}=f_{mix}(Q_1,\dots,Q_N; s)\) مع \(\frac{\partial Q_{tot}}{\partial Q_i}\ge 0\). والرتابة (monotonicity) شرط كافٍ لتحقيق IGM. تُولَّد أوزان الخالط من الحالة الشاملة بواسطة الشبكات الفائقة (hypernetworks) وتُبقى غير سالبة (بأخذ القيمة المطلقة)، بحيث تستطيع الحالة تشكيل عملية الخلط مع بقاء الرتابة قائمة.
  • QTRAN و QPLEX و Weighted QMIX: تُرخي شرط الرتابة لتمثيل تنسيق أغنى (غير رتيب) مع الحفاظ على IGM.

لماذا يفرض QMIX أوزان خلط غير سالبة

المختبر 9 · اتساق IGM

يختار كل من الروبوتين الفعل 0 أو 1. اضبط منافعهما الفردية وأوزان الخلط (خالط خطي \(Q_{tot}=w_1Q_1+w_2Q_2\)؛ و VDN هو \(w_1=w_2=1\)). الخلية المظلّلة: أفضل فعل مشترك للفريق. الخلية المتقطّعة: ما يختاره كل روبوت بالنظر إلى \(Q_i\) الخاص به فقط. اجعل أحد الأوزان سالبًا وراقبهما يختلفان.

2 · تدرّجات السياسة بناقد مركزي (أي بنية مكافأة، والأفعال المتصلة ممكنة)

MADDPG (Lowe et al., 2017): لكل وكيل فاعل حتمي \(\mu_i(o_i)\) وناقد مركزي \(Q_i(\mathbf{x}, a_1,\dots,a_N)\) يرى أرصاد الجميع وأفعالهم. يعمل في الإعدادات التعاونية والتنافسية والمختلطة، ويتعامل مع التحكم المتصل كالتوجيه.

\[ \nabla_{\theta_i}J = \mathbb{E}\big[\nabla_{\theta_i}\mu_i(o_i)\,\nabla_{a_i}Q_i(\mathbf x,a_1,\dots,a_N)\big|_{a_i=\mu_i(o_i)}\big] \]

COMA (Foerster et al., 2018) يستهدف إسناد الفضل. فهو يسأل: «بكم كان فعلي أفضل مما كنت سأفعله عادةً، مع تثبيت أفعال الجميع الآخرين؟»، مستخدمًا خط أساس مضادًّا للواقع (counterfactual baseline):

\[ A_i(s,\mathbf a) = Q(s,\mathbf a) - \sum_{a_i'}\pi_i(a_i'\mid\tau_i)\,Q\big(s,(\mathbf a_{-i},a_i')\big) \]

MAPPO (Yu et al., 2022, "The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games"): فاعلو PPO مع مشاركة المعاملات، إضافةً إلى دالة قيمة مركزية \(V_\phi(s)\). يضاهي الطرائق الأعقد أو يتفوّق عليها في SMAC و MPE و Google Research Football، وهو خط الأساس القوي الافتراضي في MARL للروبوتات. أمّا HAPPO/HATRPO (Kuba et al., 2022) فتحدّث الوكلاء تتابعيًا وتأتي بضمان تحسّن رتيب للوكلاء غير المتجانسين.

# MAPPO: الحلقة التي ينبغي أن تستطيع رسمها على السبّورة
for iteration in range(K):
    for t in range(T):                            # جمع المسارات في محاكاة متوازية
        a_i, logp_i = actor_θ(o_i)  for each agent i     # أوزان مشتركة + معرّف الوكيل
        s', o', r, done = env.step(a_1..a_N)
        buffer.add(o_i, a_i, logp_i, s, r, done)
    A_i  = GAE(r, V_φ(s), γ, λ)                   # الناقد المركزي يرى الحالة الشاملة
    for epoch in range(E):
        θ ← θ + ∇ L_CLIP(θ; A_i)                   # قصّ PPO لكل عيّنة وكيل
        φ ← φ − ∇ (V_φ(s) − R̂)²
# النشر: لا يعمل على كل روبوت سوى actor_θ(o_i)
3 · التوسّع والتواصل
  • مشاركة المعاملات (Parameter sharing): شبكة واحدة لجميع الوكلاء المتجانسين، مع معرّف الوكيل ضمن المُدخل. كفؤة في استخدام العيّنات، وهي الخيار المعياري للأساطيل.
  • MARL بالحقل المتوسط (Mean-field MARL) (Yang et al., 2018): تقريب الآخرين بـمتوسط أفعالهم، \(Q_i(s,a_i,\bar a_{-i})\). يتوسّع هذا إلى مئات الوكلاء (مرور كثيف، أسراب).
  • الشبكات العصبية البيانية / الانتباه (attention): الوكلاء عُقد، والجيران ضمن مدى الاستشعار حواف. تتعامل مع عدد متغيّر من السيارات، وهي لا متغيّرة تحت التباديل (permutation-invariant).
  • التواصل المُتعلَّم (Learned communication): CommNet (Sukhbaatar et al., 2016)، و DIAL (Foerster et al., 2016)، و TarMAC (Das et al., 2019، رسائل انتباه موجَّهة). وهي النظير لاتصال V2V.
الخوارزميةالعائلةمُدخل الناقد / الخالطالأفعالالمكافآتاستخدمها حين
IQL / IPPOمستقلةمحليمتقطّعة / كلاهماأي نوعخط أساس، و N ضخم جدًا
VDNتفكيك القيمةمجموع \(Q_i\)متقطّعةمشتركةمهام تعاونية بسيطة
QMIXتفكيك القيمةخلط رتيب + \(s\)متقطّعةمشتركةتعاون مع تنسيق يعتمد على الحالة
COMAفاعل–ناقد\(Q(s,\mathbf a)\) مضادّ للواقعمتقطّعةمشتركةحين يكون إسناد الفضل مهمًا
MADDPGفاعل–ناقد\(Q_i(\mathbf x,\mathbf a)\)متصلةأي نوعدوافع مختلطة، وتحكم متصل
MAPPOفاعل–ناقد\(V(s)\)كلاهمامشتركة (غالبًا)خط الأساس القوي الافتراضي
Mean-field Q/ACتقريب\(\bar a\) للجيرانمتقطّعةأي نوعأعداد كبيرة جدًا من الوكلاء المتشابهين
الفصل 10بحث

MARL للروبوتات والسيارات ذاتية القيادة

صياغة كاملة بمثال محلول

هكذا تبدو شريحة قوية في حلقة بحثية بعنوان «كيف سأصوغ المسألة». السيناريو: N مركبة ذاتية القيادة متصلة (AVs) تتفاوض على عبور تقاطع بلا إشارات وسط حركة مرور يقودها بشر.

المكوّنالاختيارالسبب
النموذجDec-POMDP (تعاوني بين المركبات الذاتية)، والبشر جزء من البيئة ← استقلالية مختلطة (mixed autonomy)تتشارك المركبات الذاتية هدفًا واحدًا للأسطول؛ أمّا البشر فغير خاضعين للتحكم
الرصد \(o_i\)سرعة المركبة الذاتية، واتجاهها، ومسارها، والمسافة إلى نقطة التعارض؛ والوضعية والسرعة النسبيتان لأقرب k=5 مركبات؛ ونيّة المسار؛ ورسائل V2V اختياريةحجم ثابت يناسب الشبكات متعددة الطبقات (MLPs)؛ استخدم GNN أو الانتباه لقيمة k متغيّرة
الفعل \(a_i\)تسارع متصل \(\in[-4,2]\ \text{m/s}^2\) على طول مسار مخطَّط، أو متقطّع {إفساح، زحف، انطلاق}بنية هرمية: يقرّر RL السلوك، ويتتبّعه متحكّم كلاسيكي (MPC/PID)، وهذا أكثر أمانًا وأسهل نقلًا
المكافأة \(r\)\(w_1\,\text{progress} - w_2\,\mathbb{1}[\text{collision}] - w_3\,|\text{jerk}| - w_4\,\mathbb{1}[\text{TTC}<\tau]\)الكفاءة والسلامة والراحة. احذر من التحايل على المكافأة (reward hacking) (مثل عدم دخول التقاطع أبدًا)
الخوارزميةMAPPO مع مشاركة المعاملات + ناقد مركزي على الحالة الشاملةمستقرة، وقابلة للتوسّع، وقابلة للنشر وفق CTDE
طبقة السلامةMDP مقيَّدة (Lagrangian PPO) أو درع سلامة (safety shield) / مرشّح بدوال حاجز التحكم (control-barrier-function) على الأفعالعقوبات المكافأة وحدها لا تضمن السلامة
المقاييسمعدّل النجاح، ومعدّل الاصطدام، ومتوسط زمن الرحلة، والإنتاجية (throughput)، والارتجاج (jerk)، والتعميم على كثافات مرور غير مرئيةأبلِغ عن المتوسط ± الانحراف المعياري على ≥ 5 بذور (seeds)
أين يُطبَّق MARL
  • الاندماج في الطرق السريعة وتغيير المسار: التفاوض مع المركبات التعاونية والمركبات التي يقودها بشر. صاغ Shalev-Shwartz et al. (2016) القيادة الآمنة متعددة الوكلاء بوصفها RL مع قيود سلامة صارمة.
  • التقاطعات والدوّارات: تنسيق بلا إشارات؛ وكذلك التحكم في إشارات المرور، حيث تكون كل إشارة وكيلًا.
  • تسيير القوافل (Platooning) / مثبّت السرعة التكيّفي التعاوني: استقرار السلسلة (string stability)، وتوفير الوقود.
  • الاستقلالية المختلطة: عدد قليل من المركبات الذاتية يخفّف موجات التوقّف والانطلاق لصالح حركة المرور البشرية (Wu et al.، إطار Flow على SUMO).
  • القيادة الاجتماعية: التوجّه نحو القيمة الاجتماعية (Social Value Orientation)، أي تقدير مدى أنانية السائقين الآخرين أو إيثارهم (Schwarting et al., PNAS 2019).
  • ملاحة الروبوتات المتعددة: تجنّب الاصطدام اللامركزي انطلاقًا من بيانات LiDAR الخام باستخدام PPO وسياسة مشتركة (Long et al., ICRA 2018)؛ وأساطيل المستودعات؛ وتغطية المناطق بطائرات مسيّرة متعددة؛ والمعالجة بأذرع متعددة.
محاكيات ومعايير مرجعية ينبغي ذكرها بدقة
الأداةما هي
SMARTS (Huawei, 2020)محاكاة قيادة متعددة الوكلاء مصمَّمة لـ MARL، بسيناريوهات تفاعل واقعية
MetaDriveمشاهد قيادة خفيفة مولَّدة إجرائيًا، مع خرائط متعددة الوكلاء (دوّار، تقاطع، عنق زجاجة، موقف سيارات)
highway-envبيئات ثنائية الأبعاد بسيطة للطريق السريع/الاندماج/التقاطع، بواجهة Gymnasium البرمجية، ممتازة للنماذج الأولية السريعة
CARLA / SUMO + Flowمحاكاة ثلاثية الأبعاد عالية الدقة / محاكاة مرورية مجهرية للاستقلالية المختلطة
VMAS، MPE، PettingZooمحاكيات متّجهة للروبوتات المتعددة (VMAS، دفعات على وحدة المعالجة الرسومية GPU)؛ وبيئات الجسيمات؛ وواجهة برمجية معيارية متعددة الوكلاء
SMAC / SMACv2الإدارة الدقيقة للوحدات في StarCraft: المعيار المرجعي القياسي لـ MARL التعاوني (ليس في الروبوتات، لكن المحكّمين يتوقّعونه)
المكتباتEPyMARL، و BenchMARL (TorchRL)، و MARLlib، و RLlib multi-agent
مسائل مفتوحة: اتجاهات جيدة للدكتوراه
  • السلامة المضمونة: MARL المقيَّد، والتدريع (shielding)، ودوال حاجز التحكم (CBFs) في الإعدادات متعددة الوكلاء؛ والتحقّق من السياسات المتعلَّمة.
  • من المحاكاة إلى الواقع (Sim-to-real): التعشية النطاقية (domain randomisation)، وتعرّف الأنظمة (system identification)، والمتانة أمام ضوضاء الحسّاسات والتأخير. والفجوة أكبر في حالة تعدّد الوكلاء، لأن سلوك الوكلاء الآخرين يتغيّر أيضًا.
  • التفاعل مع البشر: نمذجة السائقين البشريين غير المتجانسين، والتنسيق دون تدريب مسبق (zero-shot coordination) / العمل الجماعي الارتجالي (ad hoc teamwork) مع شركاء مجهولين.
  • قابلية التوسّع و N المتغيّر: سياسات بيانية/قائمة على الانتباه تعمّم من 5 سيارات في التدريب إلى 50 في الاختبار.
  • التواصل تحت القيود: عرض النطاق، والتأخير، وانقطاع الاتصال في V2V؛ وماذا ينبغي أن يُتواصَل بشأنه.
  • المتانة والخصوم: وكلاء عدائيون لاختبار أنظمة المركبات الذاتية تحت الضغط (استخدام تنافسي لـ MARL).
  • MARL غير المتصل (Offline MARL): التعلّم من بيانات الأسطول المسجَّلة دون استكشاف مباشر محفوف بالمخاطر.
  • التقييم: البذور، وتنوّع السيناريوهات، والمقاييس المعيارية. يعاني هذا المجال مشكلات حقيقية في قابلية إعادة إنتاج النتائج.
الفصل 11عرضك التقديمي

عدّة الحلقة البحثية: ورقة مراجعة سريعة، وأسئلة صعبة، واختبار ذاتي

هيكل من 6 شرائح لعرضك
  • الدافع: القيادة متعددة الوكلاء بطبيعتها؛ والتعلّم المعزَّز لوكيل واحد يعامل السيارات الأخرى كضوضاء.
  • الصياغة الشكلية: MDP ← لعبة ماركوف ← Dec-POMDP (شريحة واحدة، ثلاث صفوف مرتّبة (tuples)).
  • لماذا هو صعب: عدم الثبات، وإسناد الفضل، و \(|\mathcal A|^N\)، وقابلية الرصد الجزئية.
  • CTDE والعائلات الرئيسية: تفكيك القيمة (QMIX، IGM) مقابل النقّاد المركزيين (MAPPO، MADDPG).
  • التطبيق: جدول صياغة التقاطع من الفصل 10.
  • المسائل المفتوحة وزاويتك البحثية: السلامة، ومن المحاكاة إلى الواقع، والتفاعل مع البشر، وقابلية التوسّع.
ورقة المعادلات المختصرة
الفكرةالمعادلة
العائد\(G_t=\sum_k\gamma^k r_{t+k+1}=r_{t+1}+\gamma G_{t+1}\)
أمثلية بلمان\(Q^*(s,a)=\mathbb E[r+\gamma\max_{a'}Q^*(s',a')]\)
MC / TD\(V\leftarrow V+\alpha(G-V)\) · \(V\leftarrow V+\alpha(r+\gamma V'-V)\)
تعلّم Q\(Q\leftarrow Q+\alpha(r+\gamma\max_{a'}Q'-Q)\)
تدرّج السياسة\(\nabla J=\mathbb E[\nabla\log\pi(a\mid s)A(s,a)]\)
PPO\(\min(\rho\hat A,\ \mathrm{clip}(\rho,1\pm\epsilon)\hat A)\)
ناش\(V_i(\pi_i^*,\pi_{-i}^*)\ge V_i(\pi_i,\pi_{-i}^*)\ \forall i,\pi_i\)
IGM / QMIX\(\arg\max_{\mathbf a}Q_{tot}=(\arg\max_{a_i}Q_i)_i\) · \(\partial Q_{tot}/\partial Q_i\ge0\)
خط أساس COMA\(Q(s,\mathbf a)-\sum_{a_i'}\pi_i(a_i')Q(s,(\mathbf a_{-i},a_i'))\)
أسئلة يُرجَّح أن تطرحها اللجنة
«لماذا لا ندرّب ببساطة سيارة واحدة بتعلّم معزَّز لوكيل واحد ونعامل الآخرين كجزء من البيئة؟»

هذا هو التعلّم المستقل. وهو ينجح حين يكون سلوك الآخرين ثابتًا (حركة مرور مبرمجة مسبقًا). أمّا حين يتكيّفون، فإن ديناميكيات الانتقال التي تراها كل سيارة تصبح غير ثابتة: \(P(s'\mid s,a_i)=\sum_{\mathbf a_{-i}}\boldsymbol\pi_{-i}(\mathbf a_{-i}\mid s)P(s'\mid s,a_i,\mathbf a_{-i})\) تتغيّر بتغيّر \(\boldsymbol\pi_{-i}\). فلا يعود برهان تقارب تعلّم Q منطبقًا، وتحصل على تذبذب أو سوء تنسيق (المختبر 8). كما أنه يتجاهل فرص التنسيق مثل الاندماج التعاوني.

«هل يفترض CTDE وجود تواصل وقت الاختبار؟»

لا، وهذا بيت القصيد. لا يعمل على المركبة سوى الفاعلين اللامركزيين، مستخدمين الأرصاد المحلية. أمّا المعلومات المركزية فلا تُستخدم إلا في التدريب، داخل الناقد أو الخالط، الذي يُستغنى عنه عند النشر. وإن وُجد اتصال V2V فيمكنك إضافته كجزء من \(o_i\) أو كتواصل متعلَّم.

«ما قيود QMIX؟»

الرتابة شرط كافٍ لكنه غير لازم لتحقيق IGM، ولذلك لا يستطيع QMIX تمثيل القيم المشتركة التي يعتمد فيها أفضل فعل لوكيل ما على أفعال الآخرين اعتمادًا غير رتيب (مثل «انطلق فقط إن أفسح الآخر الطريق، وإلا انقلب العائد»). وتعالج QTRAN و QPLEX و Weighted QMIX هذه المسألة. كما أنه مقتصر على الأفعال المتقطّعة والإعدادات التعاونية.

«كيف تتعامل مع السلامة؟ فالتعلّم المعزَّز قد يتسبّب في حوادث.»

على طبقات: (1) صياغة CMDP، أي تعظيم المكافأة بشرط \(\mathbb E[\sum\gamma^t c_t]\le d\)، وتُحل بطرائق لاغرانج؛ (2) درع وقت التشغيل أو مرشّح بدوال حاجز التحكم يتجاوز الأفعال غير الآمنة؛ (3) تصميم هرمي يختار فيه RL السلوكيات وينفّذها متحكّم منخفض المستوى مُتحقَّق منه؛ (4) اختبار عدائي وقائم على السيناريوهات. عقوبات المكافأة وحدها لا تمنح أي ضمان.

«لماذا يعمل MAPPO بهذه الجودة مع أنه "مجرد PPO"؟»

حدّد Yu et al. تفاصيل تنفيذية مؤثّرة: تطبيع القيمة، ومُدخل حالة شاملة للناقد مع خصائص خاصة بكل وكيل، ومشاركة المعاملات، وعدد قليل من حقب PPO، وقيمة قصّ ε صغيرة للحدّ من عدم الثبات الناتج عن التحديثات المتزامنة. وتحدّ منطقة الثقة ضمنيًا من سرعة انجراف سياسات الوكلاء الآخرين.

«كيف تقيّم التعميم؟»

درِّب واختبر على كثافات مرور وهندسات طرق ونماذج سائقين بشريين مختلفة؛ غيِّر N؛ أبلِغ عن معدّلات النجاح والاصطدام مع فترات ثقة على عدة بذور؛ وأدرِج خطوط أساس قائمة على القواعد (IDM + MOBIL للطرق السريعة) وخطوط أساس بتعلّم معزَّز لوكيل واحد.

«ما الفرق بين لعبة ماركوف و Dec-POMDP؟»

تمنح لعبة ماركوف كل وكيل مكافأته الخاصة و(عادةً) رصدًا كاملًا للحالة؛ وهي تغطّي الإعدادات التنافسية والمختلطة. أمّا Dec-POMDP فتعاونية (مكافأة واحدة مشتركة) وجزئية الرصد (لكل وكيل دالة رصد خاصة به). وتعمّم POSG (اللعبة العشوائية جزئية الرصد) كلتيهما.

اختبار ذاتي

النتيجة: 0 / 0

مراجع موصى بها: Sutton & Barto, Reinforcement Learning: An Introduction (التعلّم المعزَّز: مقدّمة؛ الطبعة الثانية، متاح مجانًا على الإنترنت)؛ Albrecht, Christianos & Schäfer, Multi-Agent Reinforcement Learning: Foundations and Modern Approaches (التعلّم المعزَّز متعدد الوكلاء: الأسس والمقاربات الحديثة؛ MIT Press, 2024، ملف PDF مجاني)؛ Zhang, Yang & Başar, "Multi-Agent RL: A Selective Overview of Theories and Algorithms" (2021).