中文

Mr. Right:基于图像与文本表示的多模态检索

信息检索 2022-09-29 v1

摘要

多模态学习是近期的一项挑战,它将单模态学习的领域推广到文本、图像或语音等多样模态,从而扩展了其范围。这种扩展要求模型处理并关联来自多个模态的信息。在信息检索中,传统检索任务关注单模态文档与查询间的相似性,而图像-文本检索假设多数文本包含来自图像的场景上下文。这种分离忽视了真实世界查询可能涉及文本内容、图像描述或两者兼具。为此,我们引入基于图像与文本表示的多模态检索(Mr. Right),一个新颖且全面的多模态检索数据集。我们利用富含文本-图像样本的 Wikipedia 数据集,并生成三类具有不同模态信息的基于文本的查询:文本相关、图像相关与混合。为验证数据集有效性,我们提供了一种多模态训练范式,并评估了已有的文本检索与图像检索框架。结果表明,所提多模态检索可提升检索性能,但构建文本与图像良好统一的文档表示仍具挑战。我们希望 Mr. Right 能让我们更好地拓展现有检索系统,并助力推动信息检索中多模态学习的发展。

关键词

引用

@article{arxiv.2209.13764,
  title  = {Mr. Right: Multimodal Retrieval on Representation of ImaGe witH Text},
  author = {Cheng-An Hsieh and Cheng-Ping Hsieh and Pu-Jen Cheng},
  journal= {arXiv preprint arXiv:2209.13764},
  year   = {2022}
}

备注

Dataset available at https://github.com/hsiehjackson/Mr.Right