中文

迈向多模态程序性理解问题的解决

计算与语言 2021-04-21 v1

摘要

本文针对程序性多模态机器理解(M3C)问题。该任务要求人工智能理解给定的多模态指令步骤并回答问题。与仅要求理解文本输入的常规机器理解任务相比,程序性 M3C 更具挑战性,因为人工智能需要同时理解时间与时序因果因素以及多模态输入。最近 Yagcioglu 等人 [35] 引入了 RecipeQA 数据集以评估 M3C。我们的首要贡献是引入两个新的 M3C 数据集——WoodworkQA 和 DecorationQA,分别包含 16K 和 10K 个指令过程。随后我们使用文本完形填空式问答任务评估 M3C,并指出了 [35] 中问答生成方法固有的偏差,该偏差使得仅从答案选项中学习的朴素基线能够作弊。该朴素基线的表现与问答中常用的流行方法 Impatient Reader [6](对上下文和查询使用注意力)相近。我们假设数据集中自然存在的这种偏差甚至会影响性能最佳的模型。我们验证了所提出的假设,并提出了一种能够修改给定数据集以消除偏差元素的算法。最后,我们在去偏数据集上报告了若干强基线的性能。我们观察到,在修正偏差后,所有方法的性能下降了 8%–16%。我们希望这些数据集和分析能提供有价值的基准,并鼓励该领域的进一步研究。

关键词

引用

@article{arxiv.2104.10139,
  title  = {Towards Solving Multimodal Comprehension},
  author = {Pritish Sahu and Karan Sikka and Ajay Divakaran},
  journal= {arXiv preprint arXiv:2104.10139},
  year   = {2021}
}