一种用于稀疏与结构化神经注意力的正则化框架
机器学习
2019-02-26 v3 计算与语言
机器学习
摘要
现代神经网络通常配备注意力机制,该机制告诉网络在输入中应聚焦于何处。本文基于平滑最大化算子,提出一种新的稀疏与结构化注意力框架。我们证明,该算子的梯度定义了一个从实数值到概率的映射,适合用作注意力机制。我们的框架将 softmax 以及最近提出的 sparsemax 的一种轻微推广作为特例包含在内。然而,我们还展示了该框架如何融入现代结构化惩罚项,从而产生更具可解释性的注意力机制,使其聚焦于输入的整个片段或组。我们推导了高效算法来计算我们注意力机制的前向和后向传播,使其能够在通过反向传播训练的神经网络中使用。为了展示其作为现有机制的直接替代品的潜力,我们在三个大规模任务上评估了我们的注意力机制:文本蕴含、机器翻译和句子摘要。我们的注意力机制在不牺牲性能的情况下提高了可解释性;值得注意的是,在文本蕴含和摘要任务上,我们优于基于 softmax 和 sparsemax 的标准注意力机制。
引用
@article{arxiv.1705.07704,
title = {A Regularized Framework for Sparse and Structured Neural Attention},
author = {Vlad Niculae and Mathieu Blondel},
journal= {arXiv preprint arXiv:1705.07704},
year = {2019}
}
备注
In proceedings of NeurIPS 2017; added errata