中文

ReCoDe:基于强化学习的动态约束设计用于多智能体协调

机器人学 2025-08-05 v2 人工智能 机器学习 多智能体系统

摘要

约束基优化是机器人学的基石,使能够可靠地编码任务和安全要求(如碰撞避免或编队遵循)的控制器设计得以实现。然而,手工设计的约束在需要复杂协调的多智能体setting下可能会失败。我们引入ReCoDe——强化约束设计——一种去中心化、混合框架,将优化基于控制器的可靠性与多智能体强化学习的适应性相结合。Rather than丢弃专家控制器,ReCoDe通过学习捕获更细微行为的额外动态约束来改进它们,例如,通过约束智能体运动以防止在杂乱场景中的拥堵。通过局部通信,智能体在其允许的动作上共同施加约束,以在变化条件下更有效地协调。在本工作中,我们聚焦于将ReCoDe应用于需要复杂、情境依赖运动和共识的多智能体导航任务,展示了其相对于纯手工控制器、其他混合方法和标准MARL基线的优势。我们给出经验(实际机器人)和理论证据,表明即使控制器不完美,保留用户定义的控制器比从头学习更有效,特别是因为ReCoDe可以动态改变其对该控制器依赖程度。

关键词

引用

@article{arxiv.2507.19151,
  title  = {ReCoDe: Reinforcement Learning-based Dynamic Constraint Design for Multi-Agent Coordination},
  author = {Michael Amir and Guang Yang and Zhan Gao and Keisuke Okumura and Heedo Woo and Amanda Prorok},
  journal= {arXiv preprint arXiv:2507.19151},
  year   = {2025}
}

备注

To appear in CoRL 2025