中文

MMHQA-ICL:面向文本、表格与图像混合问答的多模态上下文学习

计算与语言 2023-09-12 v1

摘要

在现实世界中,知识常以多模态与异构形式存在。处理包含文本、表格与图像等混合数据类型的问答任务是一项挑战性工作(MMHQA)。近来,随着大语言模型(LLM)的兴起,上下文学习(ICL)已成为解决QA问题最流行的方式。我们提出MMHQA-ICL框架以解决此问题,其包含更强的异构数据检索器与图像描述模块。最重要的是,我们提出一种面向MMHQA的类型特定上下文学习策略,使LLM能在此任务中利用其强大性能。我们首次将端到端LLM提示方法用于该任务。实验结果表明,我们的框架优于所有基线及在全数据集上训练的方法,在MultimodalQA数据集的少样本设定下取得最先进结果。

关键词

引用

@article{arxiv.2309.04790,
  title  = {MMHQA-ICL: Multimodal In-context Learning for Hybrid Question Answering over Text, Tables and Images},
  author = {Weihao Liu and Fangyu Lei and Tongxu Luo and Jiahe Lei and Shizhu He and Jun Zhao and Kang Liu},
  journal= {arXiv preprint arXiv:2309.04790},
  year   = {2023}
}