非合作环境中多机器人规划的神经树扩展方法
机器人学
2021-07-12 v3
摘要
我们提出一种自我改进的神经树扩展(Neural Tree Expansion, NTE)方法,用于非合作环境中的多机器人在线规划,其中每个机器人试图在与其他自利机器人交互时最大化其累积奖励。我们的算法将 AlphaZero 的集中式、完全信息、离散动作空间方法适配于多机器人应用的分散式、部分信息、连续动作空间设定。我们的方法包含三个相互作用的组件:(i) 一个具有大量计算资源的集中式、完全信息“专家”蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS),提供专家示范;(ii) 一个具有少量计算资源、实时运行的分散式、部分信息“学习器”MCTS,提供自我对弈样本;(iii) 策略与价值神经网络,由专家示范训练,并对专家与学习器的树生长进行偏置。我们的数值实验证明了神经树扩展的计算优势:其以比多20倍资源的 MCTS 更优的解被发现。所得策略在动态上十分精巧,展示了机器人间的协调,并在 Reach-Target-Avoid 微分博弈中显著优于针对多机器人双积分器系统的现有最优控制论基线。我们在 aerial swarm 上的硬件实验证明了神经树扩展的计算优势,可在复杂场景中以20Hz频率实现在线规划并给出有效策略。
引用
@article{arxiv.2104.09705,
title = {Neural Tree Expansion for Multi-Robot Planning in Non-Cooperative Environments},
author = {Benjamin Riviere and Wolfgang Hoenig and Matthew Anderson and Soon-Jo Chung},
journal= {arXiv preprint arXiv:2104.09705},
year = {2021}
}
备注
Accepted at IEEE RA-L, see DOI below