基于动态输入修剪和缓存感知掩码的高效 LLM 推理
机器学习
2025-04-04 v2 计算与语言
摘要
虽然移动设备提供越来越强的计算能力,但 DRAM 带宽的改进速度要慢得多。这不利于大型语言模型(LLM)标记生成,因为其计算密集。以往的工作提出可利用 ReLU 激活 LLM 中天然的动态激活稀疏性,以减少每个标记的有效 DRAM 带宽。然而,较新的 LLM 使用 SwiGLU 而非 ReLU,导致内在稀疏性很小。虽然可以基于幅值修剪 SwiGLU 激活,但产生的稀疏模式难以预测,使以往方法不具有效性。为规克这一问题,本工作引入动态输入修剪(DIP):一种无预测器的动态稀疏化方法,通过最小化微调来保持准确性。DIP 还可使用轻量级 LoRA 适配器来恢复稀疏化期间丢失的部分性能。最后,我们描述了一种新颖的缓存感知掩码策略,该策略考虑缓存状态和激活幅值,以进一步提高缓存命中率,提高移动设备上的 LLM 标记率。DIP 在准确性、内存和吞吐量方面均优于其他方法。
引用
@article{arxiv.2412.01380,
title = {Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking},
author = {Marco Federici and Davide Belli and Mart van Baalen and Amir Jalalirad and Andrii Skliar and Bence Major and Markus Nagel and Paul Whatmough},
journal= {arXiv preprint arXiv:2412.01380},
year = {2025}
}
备注
Main Text: 10 pages, 11 figures. Appendix: 6 pages, 3 figures