中文

Flickr30K-CFQ: 一个用于文本-图像检索的紧凑碎片化查询数据集

信息检索 2024-04-02 v2

摘要

随着互联网上多模态信息的爆炸式增长,单模态搜索已无法满足互联网应用的需求。需要开展文本-图像检索研究,以实现不同模态之间的高质量、高效检索。现有的文本-图像检索研究大多基于通用的视觉-语言数据集(例如MS-COCO、Flickr30K),其中的查询语句刻板且不自然(即冗长和正式)。为了克服这一缺点,我们构建了一个新的紧凑碎片化查询挑战数据集(命名为Flickr30K-CFQ),以建模考虑多种查询内容和风格(包括紧凑且细粒度的实体关系语料库)的文本-图像检索任务。我们提出了一种基于LLM提示工程的新型查询增强文本-图像检索方法。实验表明,我们提出的Flickr30-CFQ揭示了现有视觉-语言数据集在现实文本-图像任务中的不足。我们基于LLM的查询增强方法应用于不同的现有文本-图像检索模型,在公共数据集和我们的挑战集Flickr30-CFQ上分别将查询理解性能提升了超过0.9%和2.4%。我们的项目可在 https://sites.google.com/view/Flickr30K-cfq 匿名访问。

关键词

引用

@article{arxiv.2403.13317,
  title  = {Flickr30K-CFQ: A Compact and Fragmented Query Dataset for Text-image Retrieval},
  author = {Haoyu Liu and Yaoxian Song and Xuwu Wang and Zhu Xiangru and Zhixu Li and Wei Song and Tiefeng Li},
  journal= {arXiv preprint arXiv:2403.13317},
  year   = {2024}
}