中文

RoboHorizon:用于长期机器人操作的LLM辅助多视图世界模型

机器人学 2025-01-27 v3

摘要

长期机器人操作中的高效控制由于复杂的表示和策略学习要求而具有挑战性。基于模型的视觉强化学习(RL)在应对这些挑战方面显示出巨大潜力,但仍面临显著限制,特别是在处理长期环境中的稀疏奖励和复杂视觉特征方面。为了解决这些限制,我们提出了用于长期任务的识别-感知-规划-行动(RSPA)流程,并进一步引入了RoboHorizon,一个专为长期机器人操作设计的LLM辅助多视图世界模型。在RoboHorizon中,预训练的LLM根据任务语言指令为多阶段子任务生成密集奖励结构,使机器人能够更好地识别长期任务。然后将关键帧发现集成到多视图掩码自编码器(MAE)架构中,以增强机器人感知关键任务序列的能力,加强其对长期过程的多阶段感知。利用这些密集奖励和多视图表示,构建了一个机器人世界模型来有效规划长期任务,使机器人能够通过RL算法可靠地行动。在两个代表性基准测试RLBench和FurnitureBench上的实验表明,RoboHorizon优于最先进的基于视觉模型的RL方法,在RLBench的4个短期任务上任务成功率提高了23.35%,在RLBench的6个长期任务和FurnitureBench的3个家具组装任务上提高了29.23%。

关键词

引用

@article{arxiv.2501.06605,
  title  = {RoboHorizon: An LLM-Assisted Multi-View World Model for Long-Horizon Robotic Manipulation},
  author = {Zixuan Chen and Jing Huo and Yangtao Chen and Yang Gao},
  journal= {arXiv preprint arXiv:2501.06605},
  year   = {2025}
}

备注

Under review