具有线性单元的稀疏注意力
计算与语言
2021-10-07 v2 机器学习
摘要
近来有观点认为,通过将注意力中的 softmax 函数替换为其稀疏变体,可以使编码器-解码器模型更具可解释性。在这项工作中,我们引入了一种新颖且简单的方法来实现注意力中的稀疏性:我们将 softmax 激活替换为 ReLU,并表明稀疏性自然地从这种公式中涌现。训练稳定性通过层归一化配合专用初始化或额外的门控函数来实现。我们的模型称为修正线性注意力(ReLA),易于实现且比先前提出的稀疏注意力机制更高效。我们将 ReLA 应用于 Transformer 并在五个机器翻译任务上进行实验。ReLA 取得了与多个强基线相当的翻译性能,且训练和解码速度与原始注意力相近。我们的分析表明,ReLA 实现了高稀疏率和头多样性,并且所诱导的跨注意力在源-目标词对齐上比近期基于稀疏 softmax 的模型取得更好的精度。有趣的是,ReLA 的头还会学习对某些查询不关注任何内容(即“关闭”),这是稀疏 softmax 替代方案所无法做到的。
引用
@article{arxiv.2104.07012,
title = {Sparse Attention with Linear Units},
author = {Biao Zhang and Ivan Titov and Rico Sennrich},
journal= {arXiv preprint arXiv:2104.07012},
year = {2021}
}
备注
EMNLP2021, code is available at https://github.com/bzhangGo/zero