中文

面向全景估计的语义感知表示学习

信息检索 2024-10-15 v4

摘要

全景估计是确定图像对之间变换的任务。我们的做法聚焦于采用无检测器特征匹配方法来解决此问题。先前的工作强调了 incorporating 语义信息的重要性,但仍缺乏有效利用语义信息的方法。先前的方法 suffer 从事将语义作为预处理,导致语义利用过于粗糙,在处理不同任务时缺乏适应性。在本工作中,我们寻求另一种方式来使用语义信息,即语义感知特征表示学习框架。基于此,我们提出了 SRMatcher,一种新的无检测器特征匹配方法,该方法鼓励网络学习集成的语义特征表示。具体而言,为了捕捉精确且丰富的语义,我们利用最近流行的视觉基础模型 (VFM) 的能力,这些模型在大型数据集上进行训练。然后,提出了跨图像语义感知融合块 (SFB) 以将其细粒度语义特征整合到特征表示空间中。通过减少匹配对中源于语义不一致性的误差,我们的方法能够提供更准确和真实的结果。大量实验表明,SRMatcher 在多个真实世界数据集上超越了坚实的基线并达到了 SOTA 结果。相较于前一 SOTA 方法 GeoFormer,SRMatcher 在 HPatches 上的累积曲线下面积 (AUC) 增加约 11%。此外,SRMatcher 可作为其他匹配方法如 LoFTR 的即插即用框架,显著提高精度。

关键词

引用

@article{arxiv.2407.13284,
  title  = {Semantic-aware Representation Learning for Homography Estimation},
  author = {Yuhan Liu and Qianxin Huang and Siqi Hui and Jingwen Fu and Sanping Zhou and Kangyi Wu and Pengna Li and Jinjun Wang},
  journal= {arXiv preprint arXiv:2407.13284},
  year   = {2024}
}

备注

Accepted by ACM Multimedia 2024