MuRAG:面向图像与文本开放问答的多模态检索增强生成器
计算与语言
2022-10-21 v2 人工智能
计算机视觉与模式识别
摘要
尽管语言模型在其参数中隐式存储了大量世界知识,但即便非常大的模型也常无法编码关于稀有实体与事件的信息,同时带来巨大的计算成本。近来,诸如REALM、RAG和RETRO等检索增强模型通过利用外部非参数索引将世界知识引入语言生成,并在受限模型规模下展现出令人印象深刻的性能。然而,这些方法仅限于检索文本知识,忽视了图像等其他模态中普遍存在的知识——其中大量信息未被任何文本覆盖。为应对此局限,我们提出首个多模态检索增强Transformer(MuRAG),其访问外部非参数多模态记忆以增强语言生成。MuRAG使用图像-文本与纯文本大规模语料的混合,以联合对比与生成损失进行预训练。我们在两个不同数据集上进行了实验,这些数据集需要检索并推理图像与文本以回答给定查询:WebQA与MultimodalQA。我们的结果表明,MuRAG达到了最先进的准确率,在两种数据集上及干扰项与全wiki设置下,均以10-20%的绝对优势超越现有模型。
引用
@article{arxiv.2210.02928,
title = {MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text},
author = {Wenhu Chen and Hexiang Hu and Xi Chen and Pat Verga and William W. Cohen},
journal= {arXiv preprint arXiv:2210.02928},
year = {2022}
}
备注
Accepted to EMNLP 2022 main conference