LaRoSA:通过层级旋转稀疏激活提升LLM效率
计算与语言
2026-01-06 v2
摘要
激活稀疏可减少大型语言模型(LLM)推理过程中前向传播的计算开销和内存传输。现有方法存在局限,要么需要耗时的恢复训练限制了实际应用,要么依赖经验性大小剪枝导致稀疏性波动和推理加速不稳定。本文引入LaRoSA(Layerwise Rotated Sparse Activation),一种 novel 的激活稀疏化方法,用于提升LLM效率,无需额外训练或基于大小的剪枝。我们利用层级正交旋转将输入激活转换为更适合稀疏化的旋转形式。通过在旋转激活中采用Top-K选择方法,可实现模型级稳定稀疏性和可靠的 wall-clock 时间加速。LaRoSA适用于各种规模和类型的LLM,显示出最小的性能退化和稳健的推理加速。具体而言,针对LLaMA2-7B在40%稀疏性下,LaRoSA仅产生0.17的 perplexity 差距,实现持续的1.30倍 wall-clock 时间加速,将零shot任务中的准确率差距降至仅0.54%,同时超过TEAL 1.77%和CATS 17.14%。
引用
@article{arxiv.2507.01299,
title = {La RoSA: Enhancing LLM Efficiency via Layerwise Rotated Sparse Activation},
author = {Kai Liu and Bowen Xu and Shaoyu Wu and Xin Chen and Hao Zhou and Yongliang Tao and Lulu Hu},
journal= {arXiv preprint arXiv:2507.01299},
year = {2026}
}
备注
ICML 2025 Acceptance