中文

基于非视觉侧信息的视觉重排序

计算机视觉与模式识别 2025-07-01 v2

摘要

视觉位置识别的标准方法是使用全局图像描述符来检索给定查询图像最相似的数据库图像。随后,可以通过重排序方法来进一步改进结果,对 top 满分图像进行重新排序。然而,现有方法专注于基于用于初始检索的相同图像描述符进行重排序,这一点我们认为提供了有限的额外信号。在本工作中,我们提出了 Generalized Contextual Similarity Aggregation (GCSA),这是一种基于图神经网络的重排序方法,除视觉描述符外,还可以利用其他可用副信息。例如,这可以是其他传感器数据(如来自附近 WiFi 或 BlueTooth 端点的信号强度)或几何属性(如数据库图像的相机姿态)。在许多应用中,这些信息已经存在或可获得。我们的体系结构利用 affinity 向量的概念,允许对异构多模态输入进行统一编码。我们利用覆盖室内外定位场景的两个大规模数据集进行训练和评估。在实验中,我们在图像检索指标以及下游视觉定位任务上均显示出显著改进。

关键词

引用

@article{arxiv.2504.11134,
  title  = {Visual Re-Ranking with Non-Visual Side Information},
  author = {Gustav Hanning and Gabrielle Flood and Viktor Larsson},
  journal= {arXiv preprint arXiv:2504.11134},
  year   = {2025}
}

备注

Accepted at Scandinavian Conference on Image Analysis (SCIA) 2025