中文

基于多图像的移动操作指令生成及自动指标增强

机器人学 2025-01-29 v1

摘要

我们考虑从目标物体图像和容器图像生成自由形式移动操作指令的问题。传统的图像描述模型无法生成适当的指令,因为它们的体系结构通常针对单图像进行优化。在本研究中,我们提出了一个处理目标物体和容器以生成移动操作任务的自由形式指令句子的模型。此外,我们引入一种新方法,有效地将来自学习基础和 n-gram 基础自动评估指标的分数作为奖励。这种方法使模型能够学习单词之间的共现关系以及适当的改写。结果表明,我们的方法在标准自动评估指标上优于基线方法,包括代表性的多模态大语言模型。此外,物理实验表明,使用我们的方法对语言指令数据进行增强,可提高现有多模态语言理解模型用于移动操作的性能。

关键词

引用

@article{arxiv.2501.17022,
  title  = {Mobile Manipulation Instruction Generation from Multiple Images with Automatic Metric Enhancement},
  author = {Kei Katsumata and Motonari Kambara and Daichi Yashima and Ryosuke Korekata and Komei Sugiura},
  journal= {arXiv preprint arXiv:2501.17022},
  year   = {2025}
}

备注

Accepted for IEEE RA-L 2025