前缀注意力沉箱可缓解大型语言模型量化中的激活异常
机器学习
2024-10-07 v2 计算与语言
摘要
尽管近期在 LLM 量化方面取得了进展,但激活量化仍然具有挑战性,主要是由于激活异常。常规的补救措施,例如为不同通道混合精度,引入额外开销并降低加速速度。本文开发了一种简单而有效的策略,通过防止生成问题标记来促进 per-tensor 激活量化。准确地说,我们提出了一种方法,在充当前缀时插入一组 key-value 缓存(称为 CushionCache),以减轻后续标记中的异常值。CushionCache 的工作分为两个步骤:首先,我们贪心搜索一序列提示标记,以最小化后续标记中最大激活值。然后,我们进一步调整标记缓存,以正则化后续标记的激活,使其更适合量化。该方法成功地解决了 LLM 的激活异常,为 per-tensor 激活量化方法提供了显著的性能提升。我们全面评估了该方法在广泛模型和基准上的效果,发现其显著优于 established 的 per-tensor W8A8 量化基线,并且可以无缝集成到最新的激活量化方法中。
引用
@article{arxiv.2406.12016,
title = {Prefixing Attention Sinks can Mitigate Activation Outliers for Large Language Model Quantization},
author = {Seungwoo Son and Wonpyo Park and Woohyun Han and Kyuyeun Kim and Jaeho Lee},
journal= {arXiv preprint arXiv:2406.12016},
year = {2024}
}
备注
EMNLP 2024 Main (Long)