中文

量化遇上 dLLM:扩散大语言模型训练后量化的系统研究

计算与语言 2026-03-17 v3 人工智能

摘要

扩散大语言模型 (dLLM) 的最新进展利用全注意力机制和基于去噪的解码策略,为自然语言生成任务中的自回归 (AR) LLM 提供了一种有前景的替代方案。然而,由于庞大的参数规模和极高的资源需求,将这些模型部署在边缘设备上仍具挑战性。尽管训练后量化 (PTQ) 已成为压缩 AR LLM 的广泛采用技术,但其在 dLLM 上的适用性很大程度上仍未被探索。在本工作中,我们首次对基于扩散的语言模型的量化进行了系统研究。我们首先识别出激活异常值 (activation outliers) 的存在,其特征为占据动态范围主导地位的异常大激活值。这些异常值对低位量化构成了关键挑战,因为它们使得难以保留大多数值的精度。更重要的是,我们实现了最先进的 PTQ 方法,并在多种任务类型和模型变体上进行了全面评估。我们的分析沿四个关键维度展开:位宽、量化方法、任务类别和模型类型。通过这种多视角评估,我们提供了关于 dLLM 在不同配置下量化行为的实用见解。我们希望我们的发现为未来 dLLM 高效部署的研究奠定基础。我们的代码已在 https://github.com/FelixMessi/QDLM 公开发布。

关键词

引用

@article{arxiv.2508.14896,
  title  = {Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs},
  author = {Haokun Lin and Haobo Xu and Yichen Wu and Ziyu Guo and Renrui Zhang and Zhichao Lu and Ying Wei and Qingfu Zhang and Zhenan Sun},
  journal= {arXiv preprint arXiv:2508.14896},
  year   = {2026}
}

备注

Published in Machine Intelligence Research, DOI: 10.1007/s11633-025-1624-x