中文

鲁棒即时策略:基于 Student t 回归模型的机器人操作在-context 仿照学习

机器人学 2025-06-19 v1 计算机视觉与模式识别

摘要

仿照学习 (IL) 旨在通过观察少数人类演示,使机器人能够自主完成任务。最近出现的一种 IL 变体,即 In-Context IL,利用即插即用的大型语言模型 (LLM) 作为即时策略,通过理解少数给定演示的上下文来完成新任务,而无需通过大规模演示显式更新网络模型。然而,由于 LLM 基于即时策略会出现幻觉问题(即偶尔生成偏离给定演示的差劲轨迹),其在机器人领域的可靠性受到制约。为缓解此问题,我们提出一种新的鲁棒在-context 仿照学习算法,称为鲁棒即时策略 (RIP),其利用 Student t 回归模型对即时策略的幻觉轨迹进行鲁棒性处理,以可靠地生成轨迹。具体而言,RIP 生成多个候选机器人轨迹以完成给定任务,并通过 Student t 分布对其进行聚合,因为后者有利于忽略异常值(即幻觉);从而生成一种对幻觉鲁棒的轨迹。我们的实验在模拟环境和真实世界环境中均进行,表明 RIP 在任务成功率上显著优于最新 IL 方法,尤其在日常任务的低数据场景下,成功率至少提高 26%。视频结果可在 https://sites.google.com/view/robustinstantpolicy 查看。

关键词

引用

@article{arxiv.2506.15157,
  title  = {Robust Instant Policy: Leveraging Student's t-Regression Model for Robust In-context Imitation Learning of Robot Manipulation},
  author = {Hanbit Oh and Andrea M. Salcedo-Vázquez and Ixchel G. Ramirez-Alpizar and Yukiyasu Domae},
  journal= {arXiv preprint arXiv:2506.15157},
  year   = {2025}
}

备注

IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025 accepted