中文

ELViS:跨域高效局部描述子视觉相似性

计算机视觉与模式识别 2026-03-31 v1

摘要

大规模实例级训练数据稀缺,因此模型通常在特定领域的数据集上进行训练。然而在实际检索场景中,它们必须处理多样化的领域,使得对未见数据的泛化至关重要。我们引入 ELViS,一种能够有效泛化到未见领域的图像相似性模型。与传统方法不同,本模型在相似性空间而非表示空间中运行,促进了跨域迁移。它利用局部描述子对应关系,通过带数据依赖性增益的 optimal transport 步骤抑制无信息描述子,并通过投票过程将强关联聚合为图像级相似性。这种设计注入了强大的归纳偏置,使得模型简单、高效且可解释。为评估泛化能力,我们构建了一个包含八个数据集的基准,涵盖地标、艺术品、产品和多域集合,并将 ELViS 作为重新排序方法进行评估。我们的实验表明,ELViS 在跨域场景中和平均情况下均显著优于竞争方法,同时仅需其计算成本的很小一部分。代码已公开:https://github.com/pavelsuma/ELViS/

关键词

引用

@article{arxiv.2603.28603,
  title  = {ELViS: Efficient Visual Similarity from Local Descriptors that Generalizes Across Domains},
  author = {Pavel Suma and Giorgos Kordopatis-Zilos and Yannis Kalantidis and Giorgos Tolias},
  journal= {arXiv preprint arXiv:2603.28603},
  year   = {2026}
}

备注

ICLR 2026