中文

AIC MLLM:面向鲁棒机器人操作的自主交互校正多模态大语言模型

机器人学 2024-11-19 v6 人工智能 计算机视觉与模式识别

摘要

反思和纠正失败的能力对于机器人系统与真实物体稳定交互至关重要。观察到多模态大语言模型(MLLM)的泛化和推理能力后,先前的方法旨在利用这些模型来相应地增强机器人系统。然而,这些方法通常侧重于使用额外的MLLM进行高层规划校正,而对利用失败样本来校正低层接触位姿(这在铰接物体操作中尤其容易发生)的利用有限。为填补这一空白,我们提出了自主交互校正(AIC)MLLM,它利用先前的低层交互经验来校正铰接物体的SE(3)位姿预测。具体来说,AIC MLLM首先进行微调,以获得位姿预测和反馈提示理解能力。我们设计了两种与物体交互的提示指令:1)视觉掩码,用于高亮不可移动部分以进行位置校正;2)文本描述,用于指示旋转校正的潜在方向。在推理过程中,引入了一个反馈信息提取模块来识别失败原因,使得AIC MLLM能够使用相应的提示自适应地校正位姿预测。为进一步增强操作稳定性,我们设计了一种测试时自适应策略,使AIC MLLM能够更好地适应当前场景配置。最后,在模拟和真实环境中进行了大量实验来评估所提出的方法。结果表明,我们的AIC MLLM可以通过利用交互经验提示有效地校正失败样本。我们的项目网站是https://sites.google.com/view/aic-mllm。

关键词

引用

@article{arxiv.2406.11548,
  title  = {AIC MLLM: Autonomous Interactive Correction MLLM for Robust Robotic Manipulation},
  author = {Chuyan Xiong and Chengyu Shen and Xiaoqi Li and Kaichen Zhou and Jeremy Liu and Ruiping Wang and Hao Dong},
  journal= {arXiv preprint arXiv:2406.11548},
  year   = {2024}
}