中文

CRAFT:使用基础模型自主教练化强化学习用于多机器人协调任务

机器人学 2025-10-03 v2

摘要

多智能体强化学习(MARL)为学习多智能体系统中的协调提供了强大的框架,但由于高维连续联合动作空间、复杂的奖励设计以及分散设置下非平稳转变的挑战,仍难以应用于机器人领域。相反,人类通过分阶段课程学习复杂协调,其中长期行为逐步基于更简单技能构建。为此,我们提出 CRAFT:Coaching Reinforcement learning Autonomously using Foundation models for multi-robot coordination Tasks(使用基础模型自主教练化强化学习用于多机器人协调任务),该框架利用基础模型的推理能力作为多机器人协调的“教练”。CRAFT 利用大型语言模型(LLM)的规划能力自动将长期协调任务分解为子任务序列。随后,CRAFT 使用 LLM 生成的奖励函数训练每个子任务,并通过视觉-语言模型(VLM)引导的奖励细化循环进行优化。我们在多象限导航和双臂操控任务上对 CRAFT 进行评估,展示了其学习复杂协调行为的能力。此外,我们在实际硬件实验中验证了多象限导航策略。

关键词

引用

@article{arxiv.2509.14380,
  title  = {CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks},
  author = {Seoyeon Choi and Kanghyun Ryu and Jonghoon Ock and Negar Mehr},
  journal= {arXiv preprint arXiv:2509.14380},
  year   = {2025}
}