中文

基于分布式Epigraph形式的多智能体安全最优控制求解

机器人学 2025-04-23 v1 人工智能 机器学习 多智能体系统 最优化与控制

摘要

多机器人系统的任务通常需要机器人协作完成团队目标,同时保持安全。将此问题通常形式化为约束马尔可夫决策过程(CMDP),旨在最小化全局成本并将约束违规均值控制在用户定义的阈值以下。受现实机器人应用的启发,我们将安全定义为零约束违规。虽然已提出许多安全多智能体强化学习(MARL)算法来求解CMDP,但这些算法在该设置下存在训练不稳定问题。为解决此问题,我们使用约束优化的Epigraph形式以提高训练稳定性,并证明集中Epigraph形式问题可被每个智能体以分布式方式求解。这导致一种名为Def-MARL的新型集中训练分布执行MARL算法。仿真实验在8个不同任务上进行,跨2个模拟器,结果显示Def-MARL实现了最佳整体性能,满足安全约束,保持训练稳定。真实硬件实验在Crazyflie无人机上表明,Def-MARL能够安全地协调智能体完成复杂的协作任务,优于其他方法。

关键词

引用

@article{arxiv.2504.15425,
  title  = {Solving Multi-Agent Safe Optimal Control with Distributed Epigraph Form MARL},
  author = {Songyuan Zhang and Oswin So and Mitchell Black and Zachary Serlin and Chuchu Fan},
  journal= {arXiv preprint arXiv:2504.15425},
  year   = {2025}
}

备注

28 pages, 16 figures; Accepted by Robotics: Science and Systems 2025