MoqaGPT:基于大语言模型的零样本多模态开放域问答
计算与语言
2023-10-23 v1
摘要
多模态开放域问答通常需要从图像、表格、段落等不同模态的数据库中检索证据。即便像GPT-4这样的大语言模型(LLM)在此任务上也有所不足。为使LLM能以零样本方式应对该任务,我们引入了MoqaGPT,一个简洁灵活的框架。采用绕过复杂多模态排序的分而治之策略,我们的框架可容纳新模态并无缝切换到该任务的新模型。基于LLM构建,MoqaGPT分别从各模态检索并提取答案,随后利用LLM融合该多模态信息以产生最终答案。我们的方法在MMCoQA数据集上提升性能,相较有监督基线F1提高+37.91点、EM提高+34.07点。在MultiModalQA数据集上,MoqaGPT超越零样本基线,F1提高9.5点、EM提高10.1点,并显著缩小与有监督方法的差距。我们的代码库位于https://github.com/lezhang7/MOQAGPT。
引用
@article{arxiv.2310.13265,
title = {MoqaGPT : Zero-Shot Multi-modal Open-domain Question Answering with Large Language Model},
author = {Le Zhang and Yihong Wu and Fengran Mo and Jian-Yun Nie and Aishwarya Agrawal},
journal= {arXiv preprint arXiv:2310.13265},
year = {2023}
}
备注
Accepted into EMNLP2023 Findings