中文

探索与利用多粒度表示用于机器阅读理解

计算与语言 2022-08-19 v1 人工智能

摘要

近年来,以 Transformer 为代表的注意力增强型多层编码器在机器阅读理解(MRC)中得到了广泛研究。在预测答案时,通常的做法是仅使用预测器从最终编码器层提取信息,该层生成源序列(即段落和问题)的粗粒度表示。分析表明,随着编码层数的增加,源序列的表示从细粒度变得更加粗粒度。普遍认为,随着深度神经网络层数的增加,编码过程会为每个位置逐渐聚合相关信息,导致表示更加粗粒度,这增加了其与其他位置相似的可能性(即同质性)。这种现象会误导模型做出错误判断并降低性能。本文认为,如果预测器能够利用来自编码器的不同粒度表示,提供源序列的不同视图,从而充分利用模型的表达能力,效果会更好。为此,我们提出了一种称为自适应双向注意力-胶囊网络(ABA-Net)的新方法,它自适应地将不同层次的源表示利用到预测器中。此外,由于更好的表示是提升 MRC 性能的核心,胶囊网络和自注意力模块被精心设计为编码器的构建模块,分别提供探索局部和全局表示的能力。在 SQuAD 1.0、SQuAD 2.0 和 COQA 三个基准数据集上的实验结果证明了我们方法的有效性。特别地,我们在 SQuAD 1.0 数据集上取得了新的最先进(SOTA)性能。

关键词

引用

@article{arxiv.2208.08750,
  title  = {Exploring and Exploiting Multi-Granularity Representations for Machine Reading Comprehension},
  author = {Nuo Chen and Chenyu You},
  journal= {arXiv preprint arXiv:2208.08750},
  year   = {2022}
}

备注

13 pages. arXiv admin note: text overlap with arXiv:2012.10877; text overlap with arXiv:1804.09541 by other authors