实体图像与混合模态图像检索数据集
计算机视觉与模式识别
2025-06-04 v1 信息检索
摘要
尽管多模态学习取得了进展,但缺乏结合视觉与文本信息、具有挑战性的混合模态图像检索基准。本文引入了一个新颖的基准,以严格评估需要深度跨模态上下文理解的图像检索。我们提出了两个新数据集:为 Wikipedia 实体提供标准图像的实体图像数据集(EI),以及源自 WIT 数据集的混合模态图像检索数据集(MMIR)。MMIR 基准包含两种具有挑战性的查询类型,要求模型将文本描述锚定在所提供视觉实体的上下文中:单实体图像查询(一张实体图像配以描述性文本)和多实体图像查询(多张实体图像配以关系文本)。我们通过实证验证了该基准作为混合模态检索训练语料库和评估集的效用。两个数据集的质量通过众包人工标注得到进一步确认。这些数据集可通过 GitHub 页面获取:https://github.com/google-research-datasets/wit-retrieval。
引用
@article{arxiv.2506.02291,
title = {Entity Image and Mixed-Modal Image Retrieval Datasets},
author = {Cristian-Ioan Blaga and Paul Suganthan and Sahil Dua and Krishna Srinivasan and Enrique Alfonseca and Peter Dornbach and Tom Duerig and Imed Zitouni and Zhe Dong},
journal= {arXiv preprint arXiv:2506.02291},
year = {2025}
}