中文

PRAM: 用于高效视觉定位的任意处位置识别模型

计算机视觉与模式识别 2025-03-10 v2 机器人学

摘要

视觉定位是多种应用(如自动驾驶、AR/VR和机器人)的关键技术。对于这些实际应用,效率和准确性都很重要,尤其是在计算资源有限的边缘设备上。然而,先前的框架,如绝对位姿回归(APR)、场景坐标回归(SCR)和分层方法(HM),在室内和室外环境中要么准确性有限,要么效率有限。在本文中,我们提出了位置识别任意处模型(PRAM),一种新的框架,通过识别3D地标来高效准确地执行视觉定位。具体来说,PRAM首先以自监督方式直接在3D空间中生成地标。这些3D地标不依赖于常用的经典语义标签,可以在室内和室外场景的任何位置定义,具有更高的泛化能力。通过使用3D地标表示地图,PRAM丢弃了全局描述符、重复的局部描述符和冗余的3D点,显著提高了内存效率。然后,利用稀疏关键点(而非密集像素)作为基于Transformer的识别模块的输入令牌进行地标识别,这使得PRAM能够以高时间和内存效率识别数百个地标。在测试时,利用稀疏关键点和预测的地标标签进行异常值去除和地标级2D-3D匹配,而不是穷举的2D-2D匹配,进一步提高了时间效率。对APR、SCR、HM和PRAM在室内和室外数据集上的全面评估表明,PRAM在大规模场景中显著优于APR和SCR,并且与HM相比具有竞争力的准确性,但减少了90%以上的内存成本,运行速度快2.4倍,从而在效率和准确性之间取得了更好的平衡。

关键词

引用

@article{arxiv.2404.07785,
  title  = {PRAM: Place Recognition Anywhere Model for Efficient Visual Localization},
  author = {Fei Xue and Ignas Budvytis and Roberto Cipolla},
  journal= {arXiv preprint arXiv:2404.07785},
  year   = {2025}
}

备注

project page: https://feixue94.github.io/pram-project/