通过结构化知识与统一检索-生成增强多模态多跳问答
计算与语言
2023-08-08 v2 计算机视觉与模式识别
摘要
多模态多跳问答需要通过在不同模态的多个输入源上进行推理来回答问题。现有方法通常分别检索证据,然后使用语言模型基于检索到的证据生成答案,因此未能充分连接候选证据,且无法在检索过程中对相互依赖的关系进行建模。此外,检索与生成的流水线式方法可能在检索性能较低时导致较差的生成性能。为解决这些问题,我们提出了一种结构化知识与统一检索-生成(SKURG)方法。SKURG 采用以实体为中心的融合编码器,利用共享实体对齐来自不同模态的源。随后它使用统一的检索-生成解码器整合中间检索结果以生成答案,并自适应地确定检索步数。在 MultimodalQA 和 WebQA 两个代表性多模态多跳问答数据集上的大量实验表明,SKURG 以更少的参数在源检索和答案生成性能上均优于最先进的模型。我们的代码可在 https://github.com/HITsz-TMG/SKURG 获取。
引用
@article{arxiv.2212.08632,
title = {Enhancing Multi-modal and Multi-hop Question Answering via Structured Knowledge and Unified Retrieval-Generation},
author = {Qian Yang and Qian Chen and Wen Wang and Baotian Hu and Min Zhang},
journal= {arXiv preprint arXiv:2212.08632},
year = {2023}
}
备注
Accepted by ACM Multimedia 2023