中文

DeepSeek模型量化中性能下降的定量分析

机器学习 2025-06-16 v2 人工智能

摘要

近期,本地部署DeepSeek-R1和V3的需求很高,这可能是因为官方服务经常繁忙,以及一些组织存在数据隐私方面的担忧。虽然单机部署提供了基础设施的简洁性,但这些模型671B的FP8参数配置超出了标准8-GPU机器的实际内存限制。量化是一种广泛使用的技术,有助于减少模型的内存消耗。然而,目前尚不清楚DeepSeek-R1和V3在量化后的性能表现如何。本技术报告首次对整个DeepSeek模型系列进行了多位宽量化的定量评估。关键发现表明,与FP8相比,4位量化保持了很小的性能下降,同时能够在标准NVIDIA GPU设备上实现单机部署。我们进一步提出了DQ3_K_M,一种动态3位量化方法,在多个基准测试中显著优于传统的Q3_K_M变体,并且在大多数任务中与4位量化(Q4_K_M)方法性能相当。此外,DQ3_K_M支持在NVIDIA H100/A100和华为910B上的单机部署配置。我们在https://github.com/UnicomAI/DeepSeek-Eval发布了DQ3_K_M的实现,其中包含DeepSeek-R1和DeepSeek-V3的优化3位量化变体。

关键词

引用

@article{arxiv.2505.02390,
  title  = {Quantitative Analysis of Performance Drop in DeepSeek Model Quantization},
  author = {Enbo Zhao and Yi Shen and Shuming Shi and Jieyun Huang and Zhihao Chen and Ning Wang and Siqi Xiao and Jian Zhang and Kai Wang and Shiguo Lian},
  journal= {arXiv preprint arXiv:2505.02390},
  year   = {2025}
}

备注

This version added the results of DeepSeek-V3-0324