OpenPangu 模型在 Atlas A2 上的低位量化后训练
机器学习
2026-01-09 v2 人工智能
摘要
华为的 openPangu-Embedded-1B 和 openPangu-Embedded-7B 是 openPangu 大型语言模型的变体,旨在高效部署于 Ascend NPU。7B 变体支持三种不同的链路思考 (CoT) 推理范式,分别为 slow_think、auto_think 和 no_think,而 1B 变体仅以 no_think 模式运行,该模式采用压缩推理以提高效率。尽管 CoT 推理提高了模型能力,但生成长推理痕迹会引入巨大的内存和延迟开销,给�在 Ascend NPU 上实际部署带来挑战。本文通过低位量化技术解决了这些计算限制,将 FP16 计算转换为更高效的整数算术。我们引入统一的低位推理框架,支持 INT8 (W8A8) 和 W4A8 量化,专为 Atlas A2 上的 openPangu-Embedded 模型优化。我们的全面评估在代码生成基准测试 (HumanEval 和 MBPP) 上表明了该方法的有效性。INT8 量化在保持超过 90% FP16 基准准确率的同时,在 Atlas A2 上实现 1.5 倍的 prefill 加速。此外,W4A8 量化显著降低了内存消耗,尽管在准确率上有一定的妥协。这些发现表明,低位量化有效地促进了 Ascend NPU 上 CoT 推理的高效部署,同时保持了高模型保真度。
引用
@article{arxiv.2512.23367,
title = {Post-Training Quantization of OpenPangu Models for Efficient Deployment on Atlas A2},
author = {Yilun Luo and Huaqing Zheng and Haoqian Meng and Wenyuan Liu and Peng Zhang},
journal= {arXiv preprint arXiv:2512.23367},
year = {2026}
}