基于多层级对齐表示的开放词汇操作任务成功预测
机器人学
2024-10-02 v1 计算机视觉与模式识别
摘要
在本研究中,我们考虑了基于指令语句和操作前后的自我中心图像,由机械臂进行的开放词汇操作的任务成功预测问题。包括多模态大语言模型在内的传统方法,通常无法恰当地理解物体的详细特征和/或物体位置的细微变化。我们提出了对比度λ-Repformer,它通过将图像与指令语句对齐来预测桌面操作任务的成功。我们的方法将以下三种关键类型的特征集成到多层级对齐表示中:保留局部图像信息的特征;与自然语言对齐的特征;以及通过自然语言结构化的特征。这使得模型能够通过观察两个图像之间表示的差异来关注重要变化。我们在基于大规模标准数据集RT-1数据集以及物理机器人平台上评估了对比度λ-Repformer。结果表明,我们的方法优于包括MLLM在内的现有方法。与代表性的基于MLLM的模型相比,我们最好的模型在准确率上提高了8.66个百分点。
引用
@article{arxiv.2410.00436,
title = {Task Success Prediction for Open-Vocabulary Manipulation Based on Multi-Level Aligned Representations},
author = {Miyu Goko and Motonari Kambara and Daichi Saito and Seitaro Otsuki and Komei Sugiura},
journal= {arXiv preprint arXiv:2410.00436},
year = {2024}
}
备注
Accepted for presentation at CoRL2024