中文

NeighborRetr:平衡跨模态检索中的枢纽中心性

计算机视觉与模式识别 2025-03-14 v1

摘要

跨模态检索旨在建立不同模态(如视觉和文本数据)之间的语义鸿沟,实现其间的准确检索。尽管基于 CLIP 等模型在跨模态表示对齐方面取得了显著进展,但仍存在一个持续的挑战:枢纽问题(hubness problem),即小部分样本(枢纽)作为最近邻居被主导,导致表示偏差并降低检索准确性。现有方法通常通过后处理归一化技术来缓解枢纽问题,这些方法依赖于先验数据分布,在实际场景中可能不够实用。本文在训练过程中直接缓解枢纽问题,提出 NeighborRetr,一种新颖的方法能够有效平衡枢纽和各类邻居的学习,并自适应调整其关系。我们的方案不仅缓解了枢纽问题,还提升了检索性能,在多个跨模态检索基准测试中实现了最先进的结果。此外,NeighborRetr 对新域的广泛分布偏移表现出鲁棒的泛化能力,凸显其在实际应用中的有效性。我们将代码公开于:https://github.com/zzezze/NeighborRetr。

关键词

引用

@article{arxiv.2503.10526,
  title  = {NeighborRetr: Balancing Hub Centrality in Cross-Modal Retrieval},
  author = {Zengrong Lin and Zheng Wang and Tianwen Qian and Pan Mu and Sixian Chan and Cong Bai},
  journal= {arXiv preprint arXiv:2503.10526},
  year   = {2025}
}

备注

Accepted at CVPR 2025, 18 pages, 7 figures, 13 tables