中文

面向外部知识视觉问答的多模态稠密检索器预训练

信息检索 2023-06-30 v1 计算与语言 计算机视觉与模式识别

摘要

本文研究一类视觉问答任务,其中回答问题时必须访问外部知识。该类任务被称为外部知识视觉问答(OK-VQA)。开发 OK-VQA 系统的一个主要步骤是为给定的多模态查询检索相关文档。当前该任务最先进的非对称稠密检索模型采用多模态查询编码器与单模态文档编码器的架构。此类架构需要大量训练数据才能有效工作。我们提出了一种用于 OK-VQA 任务段落检索模型预训练的自动数据生成流程。所提方法相比当前最先进的非对称架构在 Precision@5 上提升了 26.9%。此外,所提预训练方法在零样本检索场景中展现出良好的能力。

关键词

引用

@article{arxiv.2306.16478,
  title  = {Pre-Training Multi-Modal Dense Retrievers for Outside-Knowledge Visual Question Answering},
  author = {Alireza Salemi and Mahta Rafiee and Hamed Zamani},
  journal= {arXiv preprint arXiv:2306.16478},
  year   = {2023}
}