中文

INQUIRE:一个自然世界文本到图像检索基准

计算机视觉与模式识别 2024-11-12 v3 人工智能 计算与语言 信息检索

摘要

我们提出了INQUIRE,一个旨在挑战多模态视觉语言模型进行专家级查询的文本到图像检索基准。INQUIRE包含iNaturalist 2024(iNat24),一个包含五百万自然世界图像的新数据集,以及250个专家级检索查询。这些查询与iNat24中全面标注的所有相关图像配对,共包含33,000个匹配项。查询涵盖物种识别、上下文、行为和外观等类别,强调需要细致图像理解和领域专业知识的任务。我们的基准评估两个核心检索任务:(1)INQUIRE-Fullrank,一个全数据集排序任务,以及(2)INQUIRE-Rerank,一个优化前100个检索结果的重排序任务。对一系列近期多模态模型的详细评估表明INQUIRE构成了重大挑战,最好模型的mAP@50未能超过50%。此外,我们表明使用更强大的多模态模型进行重排序可以提升检索性能,但仍存在显著改进空间。通过聚焦科学驱动的生态挑战,INQUIRE旨在弥合AI能力与现实世界科学探究需求之间的差距,鼓励开发能够加速生态和生物多样性研究的检索系统。我们的数据集和代码可在https://inquire-benchmark.github.io获取。

关键词

引用

@article{arxiv.2411.02537,
  title  = {INQUIRE: A Natural World Text-to-Image Retrieval Benchmark},
  author = {Edward Vendrow and Omiros Pantazis and Alexander Shepard and Gabriel Brostow and Kate E. Jones and Oisin Mac Aodha and Sara Beery and Grant Van Horn},
  journal= {arXiv preprint arXiv:2411.02537},
  year   = {2024}
}

备注

Published in NeurIPS 2024, Datasets and Benchmarks Track