MultiModalQA:基于文本、表格与图像的复杂问答
计算与语言
2021-04-14 v1 人工智能
机器学习
摘要
在回答复杂问题时,人们可以无缝地结合来自视觉、文本和表格来源的信息。尽管近年来对跨多证据推理模型的兴趣激增,但关于跨多种模态推理的问答模型的工作相对较少。本文提出MultiModalQA(MMQA):一个需要在文本、表格和图像上联合推理的具有挑战性的问答数据集。我们使用一种新的框架大规模生成复杂多模态问题,从维基百科获取表格,并利用各表格中出现的实体附加图像和文本段落,从而创建MMQA。随后我们定义一种形式语言,可将能从单一模态回答的问题组合生成跨模态问题。最后,众包工作者将这些自动生成的问题改写得更流畅。我们通过该流程创建了29,918个问题,并从经验上证明了采用多模态多跳方法解决本任务的必要性:我们的多跳模型ImplicitDecomp在跨模态问题上取得平均51.7的F1,大幅优于取得38.2 F1的强基线,但仍显著落后于人类表现的90.1 F1。
引用
@article{arxiv.2104.06039,
title = {MultiModalQA: Complex Question Answering over Text, Tables and Images},
author = {Alon Talmor and Ori Yoran and Amnon Catav and Dan Lahav and Yizhong Wang and Akari Asai and Gabriel Ilharco and Hannaneh Hajishirzi and Jonathan Berant},
journal= {arXiv preprint arXiv:2104.06039},
year = {2021}
}
备注
ICLR 2021