中文

大型语言模型中大规模激活值的细化分析

计算与语言 2025-03-31 v1

摘要

受低精度训练和量化相关性的启发,大规模激活值(massive activations)在大型语言模型(LLM)中近期成为值得关注的议题。然而,现有分析在范围上受限,跨架构的普遍性尚不明确。本文通过对广泛涵盖多种大型语言模型的分析,包括基于GLU结构和非GLU结构的模型,旨在填补部分空白。我们的发现挑战了若干先前假设,最重要的是:(1)并非所有大规模激活值都有害,即抑制它们不会导致困惑度爆炸或下游任务性能崩溃;(2)所提出的缓解策略如注意力KV偏置在特定情况下具有模型依赖性且无效。我们随后探讨了 novel 混合缓解策略;特别是将目标方差重缩放(Target Variance Rescaling, TVR)与注意力KV偏置或动态 tanh(Dynamic Tanh, DyT)成功地在我们调查的场景中平衡了大规模激活值的缓解与下游模型性能的保持。我们的代码已公开:https://github.com/bluorion-com/refine_massive_activations。

关键词

引用

@article{arxiv.2503.22329,
  title  = {A Refined Analysis of Massive Activations in LLMs},
  author = {Louis Owen and Nilabhra Roy Chowdhury and Abhay Kumar and Fabian Güra},
  journal= {arXiv preprint arXiv:2503.22329},
  year   = {2025}
}