EDIS:基于实体的多模态网络内容图像检索
计算与语言
2023-10-24 v2 计算机视觉与模式识别
信息检索
摘要
使图像检索方法在实际搜索应用中实用,需要在数据集规模、实体理解和多模态信息融合方面取得显著进展。本文引入\textbf{实}\textbf{体}\textbf{驱}\textbf{动}\textbf{图}\textbf{像}\textbf{检}\textbf{索}(EDIS),一个面向新闻领域跨模态图像检索的挑战性数据集。EDIS 由来自真实搜索引擎结果和精选数据集的 100 万张网络图像组成,每张图像配有一段文本描述。与假设少量单模态候选的数据集不同,EDIS 通过包含百万级多模态图像-文本对作为候选,反映了真实世界的网络图像搜索场景。EDIS 鼓励开发同时解决跨模态信息融合与匹配的检索模型。为获得准确的排序结果,模型必须:1)从文本查询中理解命名实体与事件,2)将实体定位到图像或文本描述上,3)有效融合文本与视觉表示。我们的实验结果表明,EDIS 凭借密集实体和大规模候选集对最先进的方法提出了挑战。消融研究也证明,将文本特征与视觉特征融合对提升检索结果至关重要。
引用
@article{arxiv.2305.13631,
title = {EDIS: Entity-Driven Image Search over Multimodal Web Content},
author = {Siqi Liu and Weixi Feng and Tsu-jui Fu and Wenhu Chen and William Yang Wang},
journal= {arXiv preprint arXiv:2305.13631},
year = {2023}
}
备注
EMNLP 2023 camera ready version