ELViS:跨域高效局部描述子视觉相似性
计算机视觉与模式识别
2026-03-31 v1
摘要
大规模实例级训练数据稀缺,因此模型通常在特定领域的数据集上进行训练。然而在实际检索场景中,它们必须处理多样化的领域,使得对未见数据的泛化至关重要。我们引入 ELViS,一种能够有效泛化到未见领域的图像相似性模型。与传统方法不同,本模型在相似性空间而非表示空间中运行,促进了跨域迁移。它利用局部描述子对应关系,通过带数据依赖性增益的 optimal transport 步骤抑制无信息描述子,并通过投票过程将强关联聚合为图像级相似性。这种设计注入了强大的归纳偏置,使得模型简单、高效且可解释。为评估泛化能力,我们构建了一个包含八个数据集的基准,涵盖地标、艺术品、产品和多域集合,并将 ELViS 作为重新排序方法进行评估。我们的实验表明,ELViS 在跨域场景中和平均情况下均显著优于竞争方法,同时仅需其计算成本的很小一部分。代码已公开:https://github.com/pavelsuma/ELViS/
引用
@article{arxiv.2603.28603,
title = {ELViS: Efficient Visual Similarity from Local Descriptors that Generalizes Across Domains},
author = {Pavel Suma and Giorgos Kordopatis-Zilos and Yannis Kalantidis and Giorgos Tolias},
journal= {arXiv preprint arXiv:2603.28603},
year = {2026}
}
备注
ICLR 2026