ISAAQ——用预训练 Transformer 与自底向上和自顶向下注意力攻克教科书问题
计算与语言
2020-10-02 v1 人工智能
计算机视觉与模式识别
摘要
教科书问答(Textbook Question Answering)是机器理解与视觉问答交叉领域中的一项复杂任务,需要对来自文本与图表的多元模态信息进行推理。本文首次挖掘了 transformer 语言模型以及自底向上和自顶向下注意力应对该任务所蕴含的语言与视觉理解挑战的潜力。我们并非从头训练语言-视觉 transformer,而是依赖预训练 transformer,进行微调与集成。我们加入自底向上和自顶向下注意力以识别对应于图表组成部分及其关系的感兴趣区域,从而改进针对每个问题与答案选项的相关视觉信息选择。我们的系统 ISAAQ 在所有 TQA 问题类型上均报告了前所未有的成功率,在判断题、纯文本与图表多选题上的准确率分别为 81.36%、71.11% 与 55.12%。ISAAQ 还展示了其广泛适用性,在其他高要求数据集上取得了最先进(state-of-the-art)结果。
引用
@article{arxiv.2010.00562,
title = {ISAAQ -- Mastering Textbook Questions with Pre-trained Transformers and Bottom-Up and Top-Down Attention},
author = {Jose Manuel Gomez-Perez and Raul Ortega},
journal= {arXiv preprint arXiv:2010.00562},
year = {2020}
}
备注
Accepted for publication as a long paper in EMNLP2020