无限注意力:深度注意力网络的 NNGP 与 NTK
机器学习
2020-06-19 v1 机器学习
摘要
关于宽神经网络(NN)与高斯过程(GP)之间关系的文献日益增多,这些文献证明了二者在多种 NN 架构下的等价性。例如,这种等价性使得无需 MCMC 或变分近似即可精确逼近宽贝叶斯 NN 的行为,或者无需运行优化器即可刻画由梯度下降优化的随机初始化宽 NN 的分布。我们将这些结果严格推广至包含注意力层的 NN,证明了不同于单头注意力会引发非高斯行为,多头注意力架构在头数趋于无穷时表现为 GP。我们进一步讨论了位置编码与层归一化的影响,并提出了对注意力机制的改进,使得有限宽与无限宽 NN 均能获得更好的结果。我们对注意力核进行了实证评估,在无需可训练核与高级数据预处理的情况下,在 CIFAR-10 上相较于先前 GP 的 SOTA 取得了适度提升。最后,我们为 Neural Tangents 库 (Novak et al., 2020) 引入了新功能,使得带注意力与不带注意力的 NNGP/NTK 模型均可应用于变长序列,并在 IMDb 评论数据集上给出了示例。
引用
@article{arxiv.2006.10540,
title = {Infinite attention: NNGP and NTK for deep attention networks},
author = {Jiri Hron and Yasaman Bahri and Jascha Sohl-Dickstein and Roman Novak},
journal= {arXiv preprint arXiv:2006.10540},
year = {2020}
}
备注
ICML 2020