中文

将激活敏感性作为训练后量化的统一原则

机器学习 2026-01-21 v1 人工智能

摘要

针对大语言模型的训练后量化 (PTQ) 方法依赖于启发式规则,这些规则隐式地估计哪些权重通道对模型行为的影响最大。目前出现了两种主导范式:感知激活的方法(如 AWQ)优先考虑具有大激活幅度的通道,而二阶方法(如 GPTQ)则根据输入协方差结构分配量化误差。尽管具有很强的经验性能,但这些方法在概念上仍然分散,且尚不清楚它们近似的是什么潜在量。在这项工作中,我们通过形式化激活敏感性(定义为通道级扰动对损失的预期影响),为 PTQ 提出了一个统一的理论框架。使用一阶泰勒展开,我们证明敏感性自然表现为梯度加权激活的平方范数,产生了一种有原则的通道重要性度量,该度量同时捕获了激活幅度和下游误差传播。在这个框架内,AWQ 和 GPTQ 可以被解释为在不同简化假设下恢复敏感性的互补近似。我们分析了敏感性度量的设计空间,连接了基于梯度的显著性、Fisher 信息和基于 Hessian 的准则,并阐明了它们与经典剪枝方法(如 Optimal Brain Damage 和 Optimal Brain Surgeon)的关系。这项工作并非提出一种新的量化算法,而是通过敏感性的视角为理解和比较训练后量化方法提供了概念基础。

关键词

引用

@article{arxiv.2601.11663,
  title  = {Activation Sensitivity as a Unifying Principle for Post-Training Quantization},
  author = {Bruce Changlong Xu},
  journal= {arXiv preprint arXiv:2601.11663},
  year   = {2026}
}