中文

辅助机器人中的物体实例检索:基于3D语义地图利用多视角图像微调SimSiam

机器人学 2025-09-08 v2

摘要

在日常生活中协助人类的机器人应当能够在环境中定位与用户所需物体相匹配的特定物体实例。该任务被称为实例特定图像目标导航(InstanceImageNav),要求模型能够区分同一类别下物体的不同实例。机器人领域的一个重大挑战是,当机器人从不同 3D 视点观察同一物体时,其外观可能会有显著差异,这使得准确识别和定位变得困难。在本文中,我们引入了一种名为 SimView 的方法,该方法基于环境的 3D 语义地图利用多视角图像,并使用 SimSiam 进行自监督学习,以在现场训练实例识别模型。我们使用由扫描真实家庭环境创建的逼真模拟器 Habitat Matterport 3D 验证了我们方法的有效性。我们的结果表明,与用于物体搜索的预训练多模态对比学习方法——对比语言-图像预训练(CLIP)相比,任务准确率提高了 1.7 倍。这一提升凸显了我们提出的微调方法在增强辅助机器人执行 InstanceImageNav 任务性能方面的优势。项目网站为 https://emergentsystemlabstudent.github.io/MultiViewRetrieve/。

关键词

引用

@article{arxiv.2404.09647,
  title  = {Object Instance Retrieval in Assistive Robotics: Leveraging Fine-Tuned SimSiam with Multi-View Images Based on 3D Semantic Map},
  author = {Taichi Sakaguchi and Akira Taniguchi and Yoshinobu Hagiwara and Lotfi El Hafi and Shoichi Hasegawa and Tadahiro Taniguchi},
  journal= {arXiv preprint arXiv:2404.09647},
  year   = {2025}
}

备注

See website at https://emergentsystemlabstudent.github.io/MultiViewRetrieve/. Accepted to IROS2024