中文

DenserNet:基于多尺度特征聚合的弱监督视觉定位

计算机视觉与模式识别 2021-03-15 v4

摘要

在本工作中,我们提出了一种用于视觉定位的稠密特征网络(DenserNet)。我们的工作主要有三点贡献。首先,我们设计了一种卷积神经网络(CNN)架构,该架构聚合不同语义层级的特征图以进行图像表示。利用更稠密的特征图,我们的方法能够生成更多的关键点特征并提高图像检索精度。其次,我们的模型以端到端方式训练,除正、负 GPS 标注的图像对外不需要像素级标注。我们使用弱监督三元组排序损失来学习判别性特征,并增强关键点特征在图像表示中的可重复性。最后,由于我们的架构在计算过程中共享特征与参数,因此方法计算高效。我们的方法能够在计算约束下于挑战性条件下实现准确的大规模定位。大量实验结果表明,我们的方法在四个具有挑战性的大规模定位基准和三个图像检索基准上均达到了新的 SOTA。

关键词

引用

@article{arxiv.2012.02366,
  title  = {DenserNet: Weakly Supervised Visual Localization Using Multi-scale Feature Aggregation},
  author = {Dongfang Liu and Yiming Cui and Liqi Yan and Christos Mousas and Baijian Yang and Yingjie Chen},
  journal= {arXiv preprint arXiv:2012.02366},
  year   = {2021}
}

备注

Proceeding with The Thirty-Fifth AAAI Conference on Artificial Intelligence (AAAI-21)