Pangu Ultra:在 Ascend NPU 上突破稠密大语言模型的极限
计算与语言
2025-04-14 v2 人工智能
摘要
我们提出了 Pangu Ultra,一个具有 1350 亿参数并在 Ascend 神经网络处理器(NPU)上训练的包含稠密 Transformer 模块的大语言模型(LLM)。尽管近年来 LLM 领域在突破 LLM 规模和能力方面取得了前所未有的进展,但训练如此大规模的模型仍面临重大的优化与系统挑战。为了稳定训练过程,我们提出了深度缩放夹心归一化,有效消除了深度模型训练过程中的损失尖峰。我们在 13.2 万亿多样化高质量 token 上对模型进行了预训练,并在后训练阶段进一步增强了其推理能力。为了高效地进行如此大规模的训练,我们使用了 8,192 个 Ascend NPU 并进行了一系列系统优化。在多个多样化基准上的评估表明,Pangu Ultra 显著提升了稠密 LLM(如 Llama 405B 和 Mistral Large 2)的最先进能力,甚至与 DeepSeek-R1 取得了具有竞争力的结果,后者的稀疏模型结构包含多得多的参数。我们的探索表明,Ascend NPU 能够高效且有效地训练超过千亿参数的稠密模型。我们的模型和系统将向商业客户提供。
引用
@article{arxiv.2504.07866,
title = {Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs},
author = {Yichun Yin and Wenyong Huang and Kaikai Song and Yehui Tang and Xueyu Wu and Wei Guo and Peng Guo and Yaoyuan Wang and Xiaojun Meng and Yasheng Wang and Dong Li and Can Chen and Dandan Tu and Yin Li and Fisher Yu and Ruiming Tang and Yunhe Wang and Baojun Wang and Bin Wang and Bo Wang and Boxiao Liu and Changzheng Zhang and Duyu Tang and Fei Mi and Hui Jin and Jiansheng Wei and Jiarui Qin and Jinpeng Li and Jun Zhao and Liqun Deng and Lin Li and Minghui Xu and Naifu Zhang and Nianzu Zheng and Qiang Li and Rongju Ruan and Shengjun Cheng and Tianyu Guo and Wei He and Wei Li and Weiwen Liu and Wulong Liu and Xinyi Dai and Yonghan Dong and Yu Pan and Yue Li and Yufei Wang and Yujun Li and Yunsheng Ni and Zhe Liu and Zhenhe Zhang and Zhicheng Liu},
journal= {arXiv preprint arXiv:2504.07866},
year = {2025}
}
备注
fix conflicts of latex pacakges