中文

MoqaGPT:基于大语言模型的零样本多模态开放域问答

计算与语言 2023-10-23 v1

摘要

多模态开放域问答通常需要从图像、表格、段落等不同模态的数据库中检索证据。即便像GPT-4这样的大语言模型(LLM)在此任务上也有所不足。为使LLM能以零样本方式应对该任务,我们引入了MoqaGPT,一个简洁灵活的框架。采用绕过复杂多模态排序的分而治之策略,我们的框架可容纳新模态并无缝切换到该任务的新模型。基于LLM构建,MoqaGPT分别从各模态检索并提取答案,随后利用LLM融合该多模态信息以产生最终答案。我们的方法在MMCoQA数据集上提升性能,相较有监督基线F1提高+37.91点、EM提高+34.07点。在MultiModalQA数据集上,MoqaGPT超越零样本基线,F1提高9.5点、EM提高10.1点,并显著缩小与有监督方法的差距。我们的代码库位于https://github.com/lezhang7/MOQAGPT。

关键词

引用

@article{arxiv.2310.13265,
  title  = {MoqaGPT : Zero-Shot Multi-modal Open-domain Question Answering with Large Language Model},
  author = {Le Zhang and Yihong Wu and Fengran Mo and Jian-Yun Nie and Aishwarya Agrawal},
  journal= {arXiv preprint arXiv:2310.13265},
  year   = {2023}
}

备注

Accepted into EMNLP2023 Findings