R2BC:基于单智能体演示的多智能体仿真学习
机器人学
2025-10-22 v1 人工智能
多智能体系统
摘要
仿真学习(Imitation Learning, IL)是人类教导机器人自然的方式,尤其在高质量演示易于获取时。虽然 IL 在单机器人场景中得到广泛应用,但针对多智能体系统的研究仍较少,尤其是单人为一组协作机器人提供演示的场景。本文引入并研究了轮询行为克隆(Round-Robin Behavior Cloning, R2BC),一种方法允许单人操作者通过顺序的单智能体演示有效训练多机器人系统。该方法使操作者逐一控制单个智能体,并逐步教授整个系统的多智能体行为,无需在联合的多智能体动作空间中进行演示。我们表明,R2BC 方法在四个多智能体模拟任务中,匹配甚至在某些情况下超越了基于特权同步演示训练的 oracle 行为克隆方法。最后,我们在两个实际机器人任务上部署了 R2BC,使用真实人类演示进行训练。
引用
@article{arxiv.2510.18085,
title = {R2BC: Multi-Agent Imitation Learning from Single-Agent Demonstrations},
author = {Connor Mattson and Varun Raveendra and Ellen Novoseller and Nicholas Waytowich and Vernon J. Lawhern and Daniel S. Brown},
journal= {arXiv preprint arXiv:2510.18085},
year = {2025}
}
备注
9 pages, 6 figures