中文

基于多层级对齐表示的开放词汇操作任务成功预测

机器人学 2024-10-02 v1 计算机视觉与模式识别

摘要

在本研究中,我们考虑了基于指令语句和操作前后的自我中心图像,由机械臂进行的开放词汇操作的任务成功预测问题。包括多模态大语言模型在内的传统方法,通常无法恰当地理解物体的详细特征和/或物体位置的细微变化。我们提出了对比度λ-Repformer,它通过将图像与指令语句对齐来预测桌面操作任务的成功。我们的方法将以下三种关键类型的特征集成到多层级对齐表示中:保留局部图像信息的特征;与自然语言对齐的特征;以及通过自然语言结构化的特征。这使得模型能够通过观察两个图像之间表示的差异来关注重要变化。我们在基于大规模标准数据集RT-1数据集以及物理机器人平台上评估了对比度λ-Repformer。结果表明,我们的方法优于包括MLLM在内的现有方法。与代表性的基于MLLM的模型相比,我们最好的模型在准确率上提高了8.66个百分点。

关键词

引用

@article{arxiv.2410.00436,
  title  = {Task Success Prediction for Open-Vocabulary Manipulation Based on Multi-Level Aligned Representations},
  author = {Miyu Goko and Motonari Kambara and Daichi Saito and Seitaro Otsuki and Komei Sugiura},
  journal= {arXiv preprint arXiv:2410.00436},
  year   = {2024}
}

备注

Accepted for presentation at CoRL2024