不解释掉的注意力机制
机器学习
2020-10-01 v1 机器学习
摘要
基于 Transformer 架构的模型在大量任务上取得了比基于其他竞争架构的模型更高的准确率。Transformer 的一个独特特征是其普遍应用自注意力机制,该机制允许信息在任意距离上自由流动。从通过高斯混合模型对注意力的概率视角出发,我们发现了经验证据,表明 Transformer 注意力倾向于“解释掉”某些输入神经元。为对此进行补偿,我们提出了一种双重归一化注意力方案,该方案实现简单,并在不引入显著计算或内存开销的情况下,为避免“解释掉”效应提供了理论保证。在经验上,我们表明新的注意力方案在多个知名基准上带来了性能提升。
引用
@article{arxiv.2009.14308,
title = {Attention that does not Explain Away},
author = {Nan Ding and Xinjie Fan and Zhenzhong Lan and Dale Schuurmans and Radu Soricut},
journal= {arXiv preprint arXiv:2009.14308},
year = {2020}
}