中文

基于多模态查询的端到端知识检索

计算与语言 2023-06-02 v1 计算机视觉与模式识别 信息检索

摘要

我们研究基于多模态查询的知识检索,即查询信息分散于图像与文本输入中,这是一项不同于以往跨模态检索工作的挑战性任务。我们策划了一个名为 ReMuQ 的新数据集,用于对此任务的进展进行基准测试。ReMuQ 要求系统通过整合文本与图像查询的内容,从大规模语料中检索知识。我们引入一种检索器模型“ReViz”,可直接处理输入的文本与图像,以端到端方式检索相关知识,而无需依赖于目标检测器或图像描述生成器等中间模块。我们提出一种新的预训练任务,可有效学习多模态查询的知识检索,并提升下游任务性能。我们在两个数据集(ReMuQ 与 OK-VQA)上展示了零样本设定下的检索优越性能,以及在这两个数据集上微调后的进一步提升。

关键词

引用

@article{arxiv.2306.00424,
  title  = {End-to-end Knowledge Retrieval with Multi-modal Queries},
  author = {Man Luo and Zhiyuan Fang and Tejas Gokhale and Yezhou Yang and Chitta Baral},
  journal= {arXiv preprint arXiv:2306.00424},
  year   = {2023}
}

备注

ACL 2023