中文

ReSeDis:用于大规模图像集合中基于指代的对象搜索的数据集

计算机视觉与模式识别 2025-06-19 v1

摘要

大规模视觉搜索引擎预计一次解决两个问题:(i)定位真正包含由句子描述的对象的每个图像,以及(ii)在每个命中图像中识别对象的边界框或确切像素。现有技术仅解决这一挑战的一面。视觉定位产生紧密的边界框和掩码,但基于测试图像中对象必然存在的不切实际假设,导致在 Web 规模的集合中产生大量误报。文本到图像检索在过滤大型数据库以排序相关图像方面表现出色,但仅限于整个图像匹配,无法提供细粒度定位。我们引入指代搜索与发现(ReSeDis),首个统一语料库检索与像素级定位的任务。给定自由形式的描述,ReSeDis 模型必须决定查询对象是否存在于每个图像中,如果存在,则返回其位置,输出边界框或分割掩码。为支持严格的研究,我们精选了基准数据集,确保每个描述唯一映射到散布在大规模多样化语料库中的对象实例,消除意外匹配。我们进一步设计了联合评估检索召回率和定位精度的任务特定指标。最后,我们提供了一个使用冻结视觉语言模型的零样基线,揭示了未来研究的显著潜力。ReSeDis 提供了一个真实可靠、端到端的测试平台,用于构建下一代稳健且可扩展的多模态搜索系统。

关键词

引用

@article{arxiv.2506.15180,
  title  = {ReSeDis: A Dataset for Referring-based Object Search across Large-Scale Image Collections},
  author = {Ziling Huang and Yidan Zhang and Shin'ichi Satoh},
  journal= {arXiv preprint arXiv:2506.15180},
  year   = {2025}
}