中文

ILIAS:大规模实例级图像检索

计算机视觉与模式识别 2025-06-24 v3

摘要

本工作引入了 ILIAS,一个用于大规模实例级图像检索的新测试数据集。它旨在评估当前和未来的基础模型与检索技术识别特定对象的能力。与现有数据集相比,其主要优势包括:大规模、领域多样性、准确的真值标注,以及远未达到饱和的性能。ILIAS 包含 1,000 个对象实例的查询图像和正例图像,这些图像均经人工收集,以捕捉具有挑战性的条件和多样化的领域。大规模检索是针对来自 YFCC100M 的 1 亿张干扰图像进行的。为了避免在无需额外标注工作的情况下产生假阴性,我们仅纳入了确认在 2014 年(即 YFCC100M 的编制日期)之后出现的查询对象。我们进行了广泛的基准测试,得出以下观察结果:i)在特定领域(如地标或产品)上微调的模型在该领域表现出色,但在 ILIAS 上失败;ii)使用多领域类别监督学习线性自适应层可带来性能提升,尤其是对于视觉语言模型;iii)检索重排序中的局部描述符仍然是关键要素,尤其是在存在严重背景杂乱的情况下;iv)视觉语言基础模型的文本到图像性能令人惊讶地接近相应的图像到图像情况。网站:https://vrg.fel.cvut.cz/ilias/

关键词

引用

@article{arxiv.2502.11748,
  title  = {ILIAS: Instance-Level Image retrieval At Scale},
  author = {Giorgos Kordopatis-Zilos and Vladan Stojnić and Anna Manko and Pavel Šuma and Nikolaos-Antonios Ypsilantis and Nikos Efthymiadis and Zakaria Laskar and Jiří Matas and Ondřej Chum and Giorgos Tolias},
  journal= {arXiv preprint arXiv:2502.11748},
  year   = {2025}
}

备注

CVPR 2025