用于多机器人轨迹规划中策略引导的 Stackelberg 元学习
机器人学
2024-03-19 v2
摘要
轨迹引导需要领导机器人智能体协助跟随机器人智能体协作到达目标目的地。然而,当领导者服务于一组不同的跟随者且对跟随者信息不完全时,规划协作变得困难。因此需要学习并快速适配不同的协作方案。我们提出了一种 Stackelberg 元学习方法来应对这一挑战。我们首先将引导式轨迹规划问题建模为一个动态 Stackelberg 博弈,以刻画领导者-跟随者交互。随后,我们利用元学习为不同跟随者开发协作策略。领导者从给定的跟随者集合中学习一个元最优响应模型。当某个特定跟随者发起引导请求时,领导者利用少量学习数据快速适配到该跟随者专属的模型,并据此执行轨迹引导。我们通过仿真说明,相较于其他学习方法,我们的方法在学习跟随者行为方面具有更好的泛化与适配性能。通过与零引导场景的对比,也展示了引导的价值与有效性。
引用
@article{arxiv.2211.13336,
title = {Stackelberg Meta-Learning for Strategic Guidance in Multi-Robot Trajectory Planning},
author = {Yuhan Zhao and Quanyan Zhu},
journal= {arXiv preprint arXiv:2211.13336},
year = {2024}
}