中文

基于多模态对象实例重识别的全局定位

机器人学 2025-05-02 v2 计算机视觉与模式识别

摘要

重识别 (ReID) 是计算机视觉中的一个关键挑战,主要在行人和车辆领域进行研究。然而,鲁棒的对象实例重识别对自动探索、长期感知和场景理解等任务具有重要意义,却鲜有探索。本文提出一种新型双路径对象实例重识别变换器架构,将 RGB 和深度信息相结合。通过利用深度数据,我们在显示杂乱或光照条件变化的场景中实现了 ReID 性能提升。此外,我们开发了基于 ReID 的定位框架,使其能够在不同视角下实现精确的相机定位和姿态识别。我们使用两个自构建的 RGB-D 数据集,以及来自多个开源 TUM RGB-D 数据集的序列进行验证。我们的ethods 实现了对象实例 ReID (mAP 为 75.18) 和定位精度 (在 TUM-RGBD 上成功率为 83%) 的显著提升,凸显了对象重识别在推动机器人感知方面的关键作用。我们的模型、框架和数据集已公开可用。

关键词

引用

@article{arxiv.2409.12002,
  title  = {Towards Global Localization using Multi-Modal Object-Instance Re-Identification},
  author = {Aneesh Chavan and Vaibhav Agrawal and Vineeth Bhat and Sarthak Chittawar and Siddharth Srivastava and Chetan Arora and K Madhava Krishna},
  journal= {arXiv preprint arXiv:2409.12002},
  year   = {2025}
}

备注

8 pages, 5 figures, 3 tables. Accepted at Advances in Robotics, AIR 2025 (Oral)