分布式多机器人策略的课程模仿学习
机器人学
2025-10-03 v2 机器学习
多智能体系统
摘要
由于长期协调和获取真实训练数据的困难,为多机器人系统(MRS)学习控制策略仍然是一项重大挑战。在这项工作中,我们在模仿学习框架内解决了这两个限制。首先,我们将 MRS 中课程学习的典型角色从随机器人数量增加的扩展性,转变为专注于改善长期协调。我们提出了一种课程策略,在训练期间逐渐增加专家轨迹的长度,从而稳定学习并提高长期行为的准确性。其次,我们引入了一种仅使用第三人称全局状态演示来近似每个机器人自我中心感知的方法。我们的方法通过过滤邻居、转换参考系和模拟机载传感器可变性,将理想化轨迹转化为局部可用的观测。这两项贡献被整合到一个物理知情技术中,以从观测中产生可扩展的分布式策略。我们在两个任务中进行了不同团队规模和噪声水平的实验。结果表明,我们的课程提高了长期准确性,而我们的感知估计方法产生的策略对现实的不确定性具有鲁棒性。这些策略共同使得从全局演示中学习鲁棒的分布式控制器成为可能,即使在缺乏专家动作或机载测量的情况下也是如此。
引用
@article{arxiv.2509.25097,
title = {Curriculum Imitation Learning of Distributed Multi-Robot Policies},
author = {Jesús Roche and Eduardo Sebastián and Eduardo Montijano},
journal= {arXiv preprint arXiv:2509.25097},
year = {2025}
}
备注
Accepted and presented at the Eight Iberian Robotics Conference, 2025