中文

SLMQuant:面向实际部署的小型语言模型量化基准

机器学习 2025-11-18 v1 人工智能

摘要

尽管小型语言模型(SLMs)作为大型语言模型(LLMs)的资源高效替代方案正日益受到关注,但由于模型压缩中仍未解决的效率差距,SLMs 在边缘设备上的部署仍面临挑战。虽然量化对 LLMs 证明效果显著,但其对 SLMs 的适用性研究仍严重不足,关于不同量化瓶颈和效率配置的关键问题尚未得到解答。本文引入 SLMQuant,首个系统化评估基准,用于衡量当 SLMs 应用时 LLM 压缩技术的表现。通过跨越多样化架构和任务的全面多轨评估,我们分析了最新量化方法在 SLMs 上的表现。我们的发现揭示了 SLMs 与 LLMs 在量化灵敏度方面的根本差异,表明直接移植 LLMs 优化的技术会因 SLMs 独特的架构特征和训练动力学而导致次优结果。我们识别出支配有效 SLM 量化的关键因素,并提出面向 SLMs 量身定制的压缩可操作设计原则。SLMQuant 为在边缘应用中在低端设备上实现高效 SLMs 部署奠定了基础框架,并为在资源受限场景下部署轻量级语言模型提供了关键洞见。

关键词

引用

@article{arxiv.2511.13023,
  title  = {SLMQuant:Benchmarking Small Language Model Quantization for Practical Deployment},
  author = {Jiacheng Wang and Yejun Zeng and Jinyang Guo and Yuqing Ma and Aishan Liu and Xianglong Liu},
  journal= {arXiv preprint arXiv:2511.13023},
  year   = {2025}
}