LayerNorm 在 Transformer 注意力中的表达能力作用
机器学习
2023-05-12 v2
摘要
层归一化(LayerNorm)是所有基于 Transformer 的模型中的固有组件。本文中,我们表明 LayerNorm 对其后的多头注意力层的表达能力至关重要。这与普遍认为 LayerNorm 的唯一作用是在前向传播中归一化激活值、在反向传播中归一化其梯度的观点相反。我们考虑 LayerNorm 的几何解释,并表明它由两部分组成:(a) 将输入向量投影到与 向量正交的 维空间,以及 (b) 将所有向量缩放到相同的 范数。我们表明这些组成部分对 Transformer 中随后的注意力层都很重要:(a) 投影使注意力机制能够创建对所有键均等关注的注意力查询,免去注意力学习此操作的需要;(b) 缩放使每个键都可能获得最高注意力,并防止键变得“不可被选”。我们从经验上表明,Transformer 确实在通用语言建模乃至计算如“多数表决”这样的简单函数中受益于 LayerNorm 的这些性质。我们的代码见 https://github.com/tech-srl/layer_norm_expressivity_role 。
引用
@article{arxiv.2305.02582,
title = {On the Expressivity Role of LayerNorm in Transformers' Attention},
author = {Shaked Brody and Uri Alon and Eran Yahav},
journal= {arXiv preprint arXiv:2305.02582},
year = {2023}
}
备注
Accepted as a short paper in Findings of ACL 2023