LLaMA 模型中的动态激活陷阱:实证研究
机器学习
2024-05-16 v1
摘要
本文系统性地研究了动态激活机制在 LLaMA 系列语言模型中的效用。尽管动态激活方法在使用 ReLU 激活函数的模型中具有减少计算量和提高速度的潜力,但我们的实证发现揭示了当前动态激活方案中的若干内在陷阱。通过在各种动态激活策略上进行大量实验,我们展示了 LLaMA 模型通常在需要高稀疏比率的情境下表现不如其 ReLU 对手。我们将这些缺陷归因于以下几个因素:1)动态预测激活头和神经元的内在复杂性;2)激活函数导致的稀疏性不足;3)KV 缓存跳过导致的信息保护不足。我们的分析不仅阐明了大规模 LLaMA 模型中动态激活的局限性,也为未来稀疏方案的设计提供了路线图。
引用
@article{arxiv.2405.09274,
title = {Dynamic Activation Pitfalls in LLaMA Models: An Empirical Study},
author = {Chi Ma and Mincong Huang and Chao Wang and Yujie Wang and Lei Yu},
journal= {arXiv preprint arXiv:2405.09274},
year = {2024}
}