中文

基于多模态上下文图理解与自监督开集理解的书本问答

计算与语言 2019-06-04 v2

摘要

本文提出一种求解书本问答(TQA)任务的新算法,该任务相较其他近期任务描述了更现实的问答问题。我们主要聚焦对 TQA 数据集分析所得的两个相关问题。首先,求解 TQA 问题需理解复杂输入数据中的多模态上下文。为应对从长文本课程中提取知识特征并将其与视觉特征融合的问题,我们从文本与图像建立上下文图,并提出基于图卷积网络(GCN)的新模块 f-GCN。其次,科学术语未分布于各章节,且科目在 TQA 数据集中是拆分的。为克服这一所谓“域外”问题,在学习问答问题前,我们引入一种无需任何标注的自监督开集学习过程。实验结果表明,我们的模型显著优于先前最优方法。此外,消融研究验证了结合 f-GCN 从多模态上下文提取知识的方法与我们新提出的自监督学习过程对 TQA 问题均有效。

关键词

引用

@article{arxiv.1811.00232,
  title  = {Textbook Question Answering with Multi-modal Context Graph Understanding and Self-supervised Open-set Comprehension},
  author = {Daesik Kim and Seonhoon Kim and Nojun Kwak},
  journal= {arXiv preprint arXiv:1811.00232},
  year   = {2019}
}

备注

ACL2019 Camera-ready