基于多模态上下文图理解与自监督开集理解的书本问答
计算与语言
2019-06-04 v2
摘要
本文提出一种求解书本问答(TQA)任务的新算法,该任务相较其他近期任务描述了更现实的问答问题。我们主要聚焦对 TQA 数据集分析所得的两个相关问题。首先,求解 TQA 问题需理解复杂输入数据中的多模态上下文。为应对从长文本课程中提取知识特征并将其与视觉特征融合的问题,我们从文本与图像建立上下文图,并提出基于图卷积网络(GCN)的新模块 f-GCN。其次,科学术语未分布于各章节,且科目在 TQA 数据集中是拆分的。为克服这一所谓“域外”问题,在学习问答问题前,我们引入一种无需任何标注的自监督开集学习过程。实验结果表明,我们的模型显著优于先前最优方法。此外,消融研究验证了结合 f-GCN 从多模态上下文提取知识的方法与我们新提出的自监督学习过程对 TQA 问题均有效。
引用
@article{arxiv.1811.00232,
title = {Textbook Question Answering with Multi-modal Context Graph Understanding and Self-supervised Open-set Comprehension},
author = {Daesik Kim and Seonhoon Kim and Nojun Kwak},
journal= {arXiv preprint arXiv:1811.00232},
year = {2019}
}
备注
ACL2019 Camera-ready