PTQ 在Ascend NPU上进行推理LLM的基准评估研究
机器学习
2026-02-23 v1 人工智能
计算与语言
摘要
后训练量化(PTQ)对于高效模型部署至关重要,但与GPU架构相比,在Ascend NPU上的有效性尚未得到充分探索。本文对代表性PTQ基线应用于DeepSeek-R1-Distill-Qwen系列(1.5B/7B/14B)和QwQ-32B等推理导向模型进行案例研究。我们评估了四种不同算法,涵盖从权重-only压缩到先进旋转方法的全谱 spectrum。我们的实证结果揭示了显著的平台敏感性。虽然4位权重-only量化对大模型有效,但激进的4位权重-激活方案在NPU上因层级校准不稳定而导致长上下文推理任务逻辑崩溃。相比之下,标准8位量化保持数值稳定性。此外,实际的INT8部署表明,虽然优化内核可降低延迟,但动态量化开销目前限制了端到端加速。这些发现为在Ascend NPU上部署量化推理模型提供了实用参考。
引用
@article{arxiv.2602.17693,
title = {A Case Study of Selected PTQ Baselines for Reasoning LLMs on Ascend NPU},
author = {Yuchen Luo and Fangyue Zhu and Ruining Zhou and Mingzhe Huang and Jian Zhu and Fanyu Fan and Wei Shao},
journal= {arXiv preprint arXiv:2602.17693},
year = {2026}
}