中文

ReLU 的复兴:关于无归一化大型语言模型中的信息熵过载

机器学习 2024-11-19 v3 人工智能

摘要

LayerNorm 是现代大型语言模型(LLM)中用于稳定训练和确保平滑优化的关键组件。然而,它在机制可解释性、异常特征抑制、忠实信号传递以及私人推理的计算和通信复杂度方面引入了显著挑战。本 work 探索了无归一化解码器-only LLM 中理想的激活函数。与 transformer-based 模型中对 GELU 的常规偏好相反,我们的实证发现表明,ReLU 在无 LayerNorm 模型中显著优于 GELU,带来约 8.2% 的困惑度改进。我们发现 GELU 的一个关键问题是,早期层经历信息熵过载,导致注意力头在表示容量上的低效利用。这一发现表明,类似 GELU 的平滑激活函数在无 LayerNorm 的架构中并不合适,而 ReLU 的几何特性——在输入空间中的专业化和类内选择性——导致学习动力学改进且在缺乏 LayerNorm 时更好地保留信息。本研究为优化在 LayerNorm 引入显著挑战的 transformer 架构提供了关键见解。代码和实现均可在 https://github.com/Nandan91/relu-revival-normfree 获取。

关键词

引用

@article{arxiv.2410.09637,
  title  = {ReLU's Revival: On the Entropic Overload in Normalization-Free Large Language Models},
  author = {Nandan Kumar Jha and Brandon Reagen},
  journal= {arXiv preprint arXiv:2410.09637},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024 Workshop on Attributing Model Behavior at Scale (Camera-ready version)