中文

通用视觉-语言稠密检索:学习用于多模态检索的统一表示空间

信息检索 2023-02-07 v2

摘要

本文提出通用视觉-语言稠密检索(UniVL-DR),其为多模态检索构建统一模型。UniVL-DR将查询与多模态资源编码于同一嵌入空间中,以从不同模态中搜索候选。为学习用于多模态检索的统一嵌入空间,UniVL-DR提出两项技术:1)通用嵌入优化策略,利用模态均衡难负样本对比优化嵌入空间;2)图像语言化方法,在原始数据空间弥合图像与文本间的模态鸿沟。UniVL-DR在多模态开放域问答基准WebQA上取得最先进(SOTA)性能,并在文本-文本检索与文本-图像检索两个子任务上优于所有检索模型。这表明通用多模态搜索可用统一模型替代分而治之流水线,并有益于单模态/跨模态任务。本工作所有源代码见 https://github.com/OpenMatch/UniVL-DR。

关键词

引用

@article{arxiv.2209.00179,
  title  = {Universal Vision-Language Dense Retrieval: Learning A Unified Representation Space for Multi-Modal Retrieval},
  author = {Zhenghao Liu and Chenyan Xiong and Yuanhuiyi Lv and Zhiyuan Liu and Ge Yu},
  journal= {arXiv preprint arXiv:2209.00179},
  year   = {2023}
}

备注

Accepted by ICLR 2023