中文

ViReSkill:基于技能记忆的视觉 grounding replanning,用于LLM在终身机器学习中的规划

机器人学 2025-09-30 v1 人工智能 机器学习

摘要

通过强化学习(RL)或模仿学习(IL)训练的机器人通常对新任务适应缓慢,而近期的大型语言模型(LLM)和视觉语言模型(VLM)承诺从最小数据集中进行知识丰富的规划。然而,部署LLM/VLM进行运动规划面临两个关键障碍:(i)符号计划很少被 grounding 在场景几何和物体物理学中,(ii)模型输出对于相同的提示可能有所不同,削弱了执行可靠性。我们提出了ViReSkill,一个将视觉 grounding replanning 与技能记忆相结合的框架,用于累积和复用。在发生失败时,replanner会根据当前场景生成新的动作序列,针对观察到的状态进行定制化。在成功时,将执行的计划存储为可重用的技能,并在未来的再遇到此情形时进行回放,无需额外调用LLM/VLM。该反馈循环实现了自主持续学习:每次尝试都立即扩展技能集,稳定后续执行。我们在模拟器(如LIBERO和RLBench)以及物理机器人上评估了ViReSkill。在所有设置下,它始终优于传统基线在任务成功率方面表现更好,展示了稳健的 sim-to-real 通用性。

关键词

引用

@article{arxiv.2509.24219,
  title  = {ViReSkill: Vision-Grounded Replanning with Skill Memory for LLM-Based Planning in Lifelong Robot Learning},
  author = {Tomoyuki Kagaya and Subramanian Lakshmi and Anbang Ye and Thong Jing Yuan and Jayashree Karlekar and Sugiri Pranata and Natsuki Murakami and Akira Kinose and Yang You},
  journal= {arXiv preprint arXiv:2509.24219},
  year   = {2025}
}