MoCA:融合多阶段领域预训练与交叉引导多模态注意力用于教科书问答
多媒体
2021-12-07 v1 人工智能
摘要
教科书问答(TQA)是一项复杂的多模态任务,旨在给定大段上下文描述和丰富图表的情况下推断答案。与视觉问答(VQA)相比,TQA包含大量不常见术语和各种图表输入。这给语言模型对领域特定词段的表示能力带来了新的挑战,也将多模态融合推向了更复杂的层次。为解决上述问题,我们提出了一种名为MoCA的新模型,该模型融合多阶段领域预训练和多模态交叉注意力用于TQA任务。首先,我们引入多阶段领域预训练模块,通过词段掩码策略进行无监督后预训练和有监督预微调。特别是在领域后预训练方面,我们提出了一种启发式生成算法来利用术语语料库。其次,为充分考虑上下文和图表的丰富输入,我们提出交叉引导多模态注意力,基于渐进策略更新文本、问题图表和说明图表的特性。此外,采用双门控机制来改进模型集成。实验结果表明了我们模型的优越性,在验证集和测试集划分上分别比最先进(SOTA)方法高出2.21%和2.43%。
引用
@article{arxiv.2112.02839,
title = {MoCA: Incorporating Multi-stage Domain Pretraining and Cross-guided Multimodal Attention for Textbook Question Answering},
author = {Fangzhi Xu and Qika Lin and Jun Liu and Lingling Zhang and Tianzhe Zhao and Qi Chai and Yudai Pan},
journal= {arXiv preprint arXiv:2112.02839},
year = {2021}
}
备注
9 pages, 6 figures