中文

为何以及何时应当使用池化?循环架构中的池化分析

计算与语言 2020-10-29 v2 机器学习

摘要

基于池化的循环神经网络架构持续优于不使用池化的对应架构。然而,其性能提升的原因在很大程度上未被考察。在这项工作中,我们考察了三种常用池化技术(均值池化、最大池化和注意力池化),并提出了最大注意力池化(max-attention),一种有效捕获句子中预测性词元间交互的新变体。我们发现,基于池化的架构与其非池化等价物在学习能力和位置偏置上差异显著——这解释了它们的性能优势。通过分析梯度传播,我们发现与BiLSTM相比,池化促进了更好的梯度流动。此外,我们揭示了BiLSTM在位置上偏向于序列开头和结尾的词元。池化缓解了此类偏置。因此,我们确定了池化带来巨大收益的场景:(i) 在低资源场景下,以及 (ii) 当重要词位于句子中间时。在所研究的池化技术中,最大注意力池化最为有效,在多个文本分类任务上带来了显著的性能提升。

关键词

引用

@article{arxiv.2005.00159,
  title  = {Why and when should you pool? Analyzing Pooling in Recurrent Architectures},
  author = {Pratyush Maini and Keshav Kolluru and Danish Pruthi and Mausam},
  journal= {arXiv preprint arXiv:2005.00159},
  year   = {2020}
}

备注

Accepted to Findings of EMNLP 2020, to be presented at BlackBoxNLP. Updated Version