DeepSeek 模型关键创新技术综述
机器学习
2025-03-17 v1
摘要
DeepSeek-V3 和 DeepSeek-R1 是用于通用任务和推理的领先开源大语言模型(LLM),其性能可媲美 OpenAI 和 Anthropic 等公司的最先进闭源模型,而所需的训练成本仅为其一小部分。理解 DeepSeek 成功背后的关键创新技术对于推进 LLM 研究至关重要。本文回顾了驱动这些模型卓越有效性与高效性的核心技术,包括对 Transformer 架构的改进、多头潜在注意力(Multi-Head Latent Attention)与混合专家(Mixture of Experts)等创新、多 Token 预测、算法与框架及硬件的协同设计、组相对策略优化算法、纯强化学习的训练后处理以及监督微调与强化学习交替的迭代训练。此外,我们还在这一快速发展的领域中指出了若干开放性问题,并强调了潜在的研究机遇。
引用
@article{arxiv.2503.11486,
title = {A Review of DeepSeek Models' Key Innovative Techniques},
author = {Chengen Wang and Murat Kantarcioglu},
journal= {arXiv preprint arXiv:2503.11486},
year = {2025}
}