中文

ManyModalQA:面向多样输入的模态消歧与问答

计算与语言 2020-01-23 v1 人工智能 计算机视觉与模式识别

摘要

我们提出一个新的多模态问答挑战 ManyModalQA,其中智能体必须通过考虑三种不同模态——文本、图像和表格——来回答问题。我们通过抓取 Wikipedia 收集数据,然后利用众包收集问答对。我们的问题具有歧义性,即仅根据问题难以确定包含答案的模态。为展示这种歧义性,我们构建了一个模态选择器(或消歧器)网络,与现有数据集相比,该模型在我们的挑战集上准确率明显更低,表明我们的问题更具歧义。通过分析该模型,我们探究问题中哪些词指示了模态。接下来,我们构建了一个简单的 ManyModalQA 基线模型,它基于模态选择器的预测,触发相应的预训练最先进单模态 QA 模型。我们致力于为社区提供一个新的多模态评估集,仅提供微调集,期望现有数据集和方法可用于大部分训练迁移,以鼓励无需为每个新任务配备大型整体训练集的低资源泛化。我们的基线模型与人类表现之间存在显著差距;因此,我们希望该挑战能激励端到端模态消歧与多模态 QA 模型以及迁移学习的研究。代码与数据见:https://github.com/hannandarryl/ManyModalQA

关键词

引用

@article{arxiv.2001.08034,
  title  = {ManyModalQA: Modality Disambiguation and QA over Diverse Inputs},
  author = {Darryl Hannan and Akshay Jain and Mohit Bansal},
  journal= {arXiv preprint arXiv:2001.08034},
  year   = {2020}
}

备注

AAAI 2020 (10 pages)