中文

一种用于稀疏与结构化神经注意力的正则化框架

机器学习 2019-02-26 v3 计算与语言 机器学习

摘要

现代神经网络通常配备注意力机制,该机制告诉网络在输入中应聚焦于何处。本文基于平滑最大化算子,提出一种新的稀疏与结构化注意力框架。我们证明,该算子的梯度定义了一个从实数值到概率的映射,适合用作注意力机制。我们的框架将 softmax 以及最近提出的 sparsemax 的一种轻微推广作为特例包含在内。然而,我们还展示了该框架如何融入现代结构化惩罚项,从而产生更具可解释性的注意力机制,使其聚焦于输入的整个片段或组。我们推导了高效算法来计算我们注意力机制的前向和后向传播,使其能够在通过反向传播训练的神经网络中使用。为了展示其作为现有机制的直接替代品的潜力,我们在三个大规模任务上评估了我们的注意力机制:文本蕴含、机器翻译和句子摘要。我们的注意力机制在不牺牲性能的情况下提高了可解释性;值得注意的是,在文本蕴含和摘要任务上,我们优于基于 softmax 和 sparsemax 的标准注意力机制。

关键词

引用

@article{arxiv.1705.07704,
  title  = {A Regularized Framework for Sparse and Structured Neural Attention},
  author = {Vlad Niculae and Mathieu Blondel},
  journal= {arXiv preprint arXiv:1705.07704},
  year   = {2019}
}

备注

In proceedings of NeurIPS 2017; added errata