面向多主体强化学习的协同受限策略优化
机器学习
2026-02-04 v1
摘要
受限多主体强化学习 (MARL) 面临探索与安全约束优化之间的根本性张力。现有主流方法,如拉格朗日方法,通常依赖全局惩罚或集中式评论家,对违规行为作出反应,常抑制探索并导致过于保守。我们提出 Co2PO,一种新的 MARL 通信增强框架,通过选择性、风险感知的通信实现协调驱动的安全。Co2PO 引入共享黑板架构用于广播位置意图和收益信号,由学习到的风险预测器主动预测给定扩展时间范围内潜在违规行为。通过将这些预测整合到受限优化目标中,Co2PO 允许代理人预见并在没有传统反应约束性能权衡的情况下导航集体风险。我们在复杂的多主体安全基准测试中评估了 Co2PO,其中它在实现较高回报的同时,收敛于符合成本约束的策略。消融研究进一步验证了风险触发通信、自适应门控和共享记忆组件的必要性。
引用
@article{arxiv.2602.02970,
title = {Co2PO: Coordinated Constrained Policy Optimization for Multi-Agent RL},
author = {Shrenik Patel and Christine Truong},
journal= {arXiv preprint arXiv:2602.02970},
year = {2026}
}