中文

迈向卓越的量化精度:一种层敏感方法

机器学习 2025-03-11 v1 人工智能

摘要

大型视觉与语言模型在自然语言理解、问题求解、逻辑推理和知识检索等任务中展现出了类似人类的卓越智能。然而,训练和部署这些模型需要大量的计算资源,这对其广泛应用和进一步研究构成了重大障碍。为了缓解这一挑战,已经开发了各种模型压缩技术以减少计算需求。尽管如此,现有方法通常采用统一的量化配置,未能考虑到大型神经网络模型中不同层在量化时的不同难度。本文通过利用层敏感特征(如激活敏感性和权重分布峰度)来解决这一问题,以识别难以准确量化的层并为其分配额外的内存预算。所提出的方法分别命名为 SensiBoost 和 KurtBoost,在量化精度上展现出显著提升,与基线相比,在 LLama 模型上仅需增加 2% 的内存预算即可实现高达 9% 的困惑度降低。

关键词

引用

@article{arxiv.2503.06518,
  title  = {Towards Superior Quantization Accuracy: A Layer-sensitive Approach},
  author = {Feng Zhang and Yanbin Liu and Weihua Li and Jie Lv and Xiaodan Wang and Quan Bai},
  journal= {arXiv preprint arXiv:2503.06518},
  year   = {2025}
}