中文

基于观测的可证明安全策略学习用于分散式多机器人导航

机器人学 2021-09-17 v1

摘要

安全性在多机器人导航问题中至关重要。在本文中,我们提出一种基于控制障碍函数(control barrier function, CBF)的优化器,仅使用传感器测量即以高概率和灵活性确保机器人安全。该优化器以策略网络输出的动作指令为初值,随后对其进行修正,将潜在危险的指令拉回安全区域。借助一个深度转移模型来预测周围动态的演化及不同动作的后果,CBF 模块可在合理的时间范围内引导优化。我们还提出了一种新颖的联合训练框架,通过利用来自 CBF 模块的奖励反馈,在训练和推理过程中均改善基于强化学习(Reinforcement Learning, RL)的策略与基于 CBF 的优化器之间的协作。我们观察到,与其他方法相比,采用我们方法的策略能够在显著更少的回合内维持多机器人安全的同时达到更高的成功率。实验在仿真与真实世界的多种场景中开展,结果证明了我们的方法在维持多机器人导航安全性方面的有效性。代码见 \url{https://github.com/YuxiangCui/MARL-OCBF}

关键词

引用

@article{arxiv.2109.07760,
  title  = {Learning Observation-Based Certifiable Safe Policy for Decentralized Multi-Robot Navigation},
  author = {Yuxiang Cui and Longzhong Lin and Xiaolong Huang and Dongkun Zhang and Yue Wang and Rong Xiong},
  journal= {arXiv preprint arXiv:2109.07760},
  year   = {2021}
}

备注

7 pages, 7 figures. conference