中文

面向知识密集型视觉问答的对称双编码稠密检索框架

计算机视觉与模式识别 2023-04-27 v1 计算与语言 信息检索

摘要

知识密集型视觉问答(KI-VQA)指回答关于图像的问题,其答案不在图像中。本文提出一种用于KI-VQA任务的新流程,由检索器与阅读器组成。首先,我们引入DEDR,一种对称双编码稠密检索框架,其中文档与查询通过单模态(文本)与多模态编码器编码至共享嵌入空间。我们提出一种迭代知识蒸馏方法,弥合这两个编码器表示空间之间的差距。在OK-VQA与FVQA两个公认的KI-VQA数据集上的广泛评估表明,DEDR分别比最先进基线在OK-VQA和FVQA上高出11.6%与30.9%。利用DEDR检索到的段落,我们进一步引入MM-FiD,一种编码器-解码器多模态fusion-in-decoder模型,用于生成KI-VQA任务的文本答案。MM-FiD分别编码问题、图像与每个检索段落,并在其解码器中联合使用所有段落。相比文献中有竞争力的基线,该方法在OK-VQA与FVQA上的问答准确率分别带来5.5%与8.5%的提升。

关键词

引用

@article{arxiv.2304.13649,
  title  = {A Symmetric Dual Encoding Dense Retrieval Framework for Knowledge-Intensive Visual Question Answering},
  author = {Alireza Salemi and Juan Altmayer Pizzorno and Hamed Zamani},
  journal= {arXiv preprint arXiv:2304.13649},
  year   = {2023}
}