惰性神经元现象:论Transformer中激活稀疏性的涌现
机器学习
2023-06-13 v2 计算与语言
计算机视觉与模式识别
机器学习
摘要
本文研究了具有Transformer架构的机器学习模型中一个有趣的现象:其激活图是稀疏的。所谓激活图,我们指的是多层感知机(MLP)在ReLU激活函数后的中间输出;所谓稀疏,是指对于每个MLP输入,平均仅有极少条目(如T5-Base为3.0%,ViT-B16为6.3%)非零。此外,层数更多、MLP隐藏维度更宽的更大规模Transformer,按非零条目占比衡量更为稀疏。通过大量实验,我们证明稀疏性的涌现是一种普遍现象,发生于自然语言处理与视觉任务、训练与评估数据、各种配置的Transformer、所有深度的层,以及包括MLP-mixer和2层MLP在内的其他架构。我们展示,在使用随机标签、随机输入或无限量数据的训练集时稀疏性同样涌现,表明稀疏性并非特定数据集族的结果。我们讨论了稀疏性如何立即意味着一种显著降低FLOP计数并提升Transformer效率的途径。此外,我们或许令人惊讶地证明,通过取较小k值的Top-k阈值化强制更稀疏的激活,为Transformer带来了一系列所期望但缺失的特性,即对含噪训练数据更低的敏感性、对输入损坏更强的鲁棒性,以及更好的预测置信度校准。
引用
@article{arxiv.2210.06313,
title = {The Lazy Neuron Phenomenon: On Emergence of Activation Sparsity in Transformers},
author = {Zonglin Li and Chong You and Srinadh Bhojanapalli and Daliang Li and Ankit Singh Rawat and Sashank J. Reddi and Ke Ye and Felix Chern and Felix Yu and Ruiqi Guo and Sanjiv Kumar},
journal= {arXiv preprint arXiv:2210.06313},
year = {2023}
}
备注
A short version was presented at ICLR 2023. Previous title: Large Models are Parsimonious Learners: Activation Sparsity in Trained Transformers