中文

量化 DeepSeek 模型的能力边界:面向应用的性能分析

人工智能 2025-05-19 v5 机器学习

摘要

DeepSeek-R1 以其低训练成本和卓越的推理能力著称,在各种基准上取得了最先进性能。然而,从真实应用角度对 DeepSeek 系列模型的详细评估仍有所欠缺,使得用户难以为其特定需求选择最合适的 DeepSeek 模型。为填补这一空白,我们首次使用增强版 A-Eval 基准 A-Eval-2.0 对 DeepSeek 及其相关模型(包括 DeepSeek-V3、DeepSeek-R1、DeepSeek-R1-Distill-Qwen 系列、DeepSeek-R1-Distill-Llama 系列、对应的 4 位量化模型以及推理模型 QwQ-32B)进行了全面评估。我们的系统分析揭示了若干关键洞察:(1)在给定相同模型架构和训练数据的前提下,更大参数规模的模型展现出更优性能,符合规模定律。然而,采用优化训练策略和更高质量数据时,较小的模型也能实现增强能力;(2)推理增强模型在逻辑推理任务上表现出显著性能提升,但在文本理解和生成任务上可能表现不佳;(3)随着数据难度的增加,蒸馏或推理增强为模型带来更高的性能增益。有趣的是,推理增强甚至可能对简单问题产生负面影响;(4)量化对不同能力的影响不均衡,在逻辑推理上出现显著下降,而对文本生成影响最小。基于这些结果和发现,我们设计了一本模型选择手册,使用户无需额外努力即可选择最具成本效益的模型。

关键词

引用

@article{arxiv.2502.11164,
  title  = {Quantifying the Capability Boundary of DeepSeek Models: An Application-Driven Performance Analysis},
  author = {Kaikai Zhao and Zhaoxiang Liu and Xuejiao Lei and Jiaojiao Zhao and Zhenhong Long and Zipeng Wang and Ning Wang and Meijuan An and Qingliang Meng and Peijun Yang and Minjie Hua and Chaoyang Ma and Wen Liu and Kai Wang and Shiguo Lian},
  journal= {arXiv preprint arXiv:2502.11164},
  year   = {2025}
}