面向目标对象与接收器的双模态排序:基于开放词汇指令的 DM2RM
机器人学
2024-08-16 v1 计算与语言
计算机视觉与模式识别
摘要
本研究旨在开发一种家庭服务机器人(DSR),其可通过开放词汇指令将日常物品运送到指定的家具。现有方法中,很少有能够在开放词汇指令下进行移动操作任务的图像检索设置,且大多数方法无法同时识别目标对象和接收器。我们提出了双模态排序模型(DM2RM),该模型 enables 使用基于多模态基础模型的单一模型检索目标对象和接收器的图像。我们引入一种切换机制,通过模式标记和大语言模型的短语识别来根据预测目标切换嵌入空间。为评估 DM2RM,我们构建了一个新数据集,包括来自数百个建筑规模环境收集的真实图像和由众包用户提供的指示表达。评估结果表明,所提出的 DM2RM 在图像检索设置下的标准指标上优于先前方法。此外,我们在标准化的真实世界 DSR 平台上演示了 DM2RM 的应用,包括提取和携带动作,在零样本迁移设置下实现了 82% 的任务成功率。演示视频、代码及更多材料可在 https://kkrr10.github.io/dm2rm/ 查看。
引用
@article{arxiv.2408.07910,
title = {DM2RM: Dual-Mode Multimodal Ranking for Target Objects and Receptacles Based on Open-Vocabulary Instructions},
author = {Ryosuke Korekata and Kanta Kaneda and Shunya Nagashima and Yuto Imai and Komei Sugiura},
journal= {arXiv preprint arXiv:2408.07910},
year = {2024}
}