中文

从低熵与动态稀疏性视角重审 Transformer

机器学习 2025-04-29 v1 人工智能

摘要

压缩一直是理解 Transformer 成功的关键视角。过去,我们通常将目标分布作为评估模型压缩性能的准则。然而,评估模型是否实现压缩,或比较在压缩过程中学习分布与目标分布之间信息内容的贡献,往往具有挑战性,因为目标分布通常未知,且熵计算常需指数级成本。本文在受控实验设置下探讨了这些问题。我们发现 Transformer 具备独特的归纳偏置:超越接近目标分布,它们倾向于学习更低的熵分布,这一倾向随模型规模增大而加剧。这一偏好防止 Transformer 完美对齐目标分布,反而进一步压缩其信息内容。此外,我们表明 FFN 模块在驱动这一偏置方面起关键作用。此外,尽管模型在压缩数据时会消除信息冗余,但它们也在参数内部表现出冗余,这使得压缩成为可能并可通过动态稀疏性进行表征。然而,Transformer 中的动态稀疏模式(特别是注意力和 FFN 模块)仍需进一步探索。关于此问题,我们表明更大的 Transformer 显示更强的规避注意力计算(通过残差连接)倾向,以及更低的活跃神经元比例。有趣的是,我们还发现更大模型的训练不稳定性与死神经元的突增强强相关。本工作深化了人们对 Transformer 从熵与动态稀疏性视角的理解。

关键词

引用

@article{arxiv.2504.18929,
  title  = {Revisiting Transformers through the Lens of Low Entropy and Dynamic Sparsity},
  author = {Ruifeng Ren and Yong Liu},
  journal= {arXiv preprint arXiv:2504.18929},
  year   = {2025}
}