使用物理世界搜索引擎识别日常物体的学习排序方法
机器人学
2023-12-27 v1 计算与语言
计算机视觉与模式识别
摘要
家用服务机器人为日益增长的日常护理和支持需求提供了解决方案。结合自动化和操作员干预的人机协作方法被认为是其在社会中使用的现实方法。因此,我们专注于在人机协作环境下从开放词汇用户指令中检索目标物体的任务,我们将其定义为学习排序物理物体(LTRPO)任务。例如,给定指令“请去有圆桌的餐厅。拿起桌上的瓶子”,模型需要输出一个排序的目标物体列表,供操作员/用户选择。在本文中,我们提出了MultiRankIt,这是一种针对LTRPO任务的新方法。MultiRankIt引入了跨模态名词短语编码器来建模包含指代表达的短语与目标边界框之间的关系,以及跨模态区域特征编码器来建模目标物体与其周围环境的多张图像之间的关系。此外,我们为LTRPO任务构建了一个新数据集,该数据集包含带有复杂指代表达的指令以及具有各种目标物体的真实室内环境图像。我们在该数据集上验证了我们的模型,它在平均倒数排名和recall@k方面优于基线方法。此外,我们在一个标准化家庭环境中进行了物理实验,让家用服务机器人根据用户在人机协作环境下的指令检索日常物体。实验结果表明,物体检索的成功率达到80%。我们的代码可在https://github.com/keio-smilab23/MultiRankIt获取。
引用
@article{arxiv.2312.15844,
title = {Learning-To-Rank Approach for Identifying Everyday Objects Using a Physical-World Search Engine},
author = {Kanta Kaneda and Shunya Nagashima and Ryosuke Korekata and Motonari Kambara and Komei Sugiura},
journal= {arXiv preprint arXiv:2312.15844},
year = {2023}
}
备注
Accepted for RAL 2023