中文

基于末端执行器轨迹预测开放词汇对象操作任务的未来成功情况

机器人学 2025-01-09 v2 计算机视觉与模式识别

摘要

本研究 addresses a旨 into预测开放词汇对象操作任务未来成功或失败的任务。该任务要求模型基于自然语言指令、操纵前的第三人称视角图像以及给定的末端执行器轨迹进行预测。传统方法通常仅在操作执行后才进行成功预测,限制了其在执行整个任务序列时的效率。我们提出了一种新方法,使模型能够通过对齐给定的轨迹和图像与自然语言指令来预测操作结果的成功或失败。我们引入轨迹编码器以对输入轨迹应用可学习的加权,使模型能够考虑物体与末端执行器之间的时序动态和相互作用,从而提高其准确预测操作结果的能力。我们构建了一个基于RT-1数据集的数据集,用于评估我们的方法。实验结果显示,我们的方法在其他基线方法之上的预测准确率更高。

关键词

引用

@article{arxiv.2412.19112,
  title  = {Future Success Prediction in Open-Vocabulary Object Manipulation Tasks Based on End-Effector Trajectories},
  author = {Motonari Kambara and Komei Sugiura},
  journal= {arXiv preprint arXiv:2412.19112},
  year   = {2025}
}

备注

Accepted for presentation at LangRob @ CoRL 2024