PTQ4ARVG:面向自回归视觉生成模型的后训练量化
计算机视觉与模式识别
2026-01-30 v1 人工智能
摘要
自回归视觉生成(ARVG)模型保留与语言模型兼容的架构,同时实现了与扩散模型相当的性能。量化在神经网络中常用于减少模型规模和计算延迟。然而,将量化应用于ARVG仍 largely 未被充分探索,现有量化方法难以有效适用于ARVG模型。本文针对上述问题,识别出三个关键挑战:(1)通道级严重的离群值,(2)标记级高度动态的激活,(3)样本级分布信息不匹配。为此,我们提出了PTQ4ARVG,一个无需训练的后训练量化(PTQ)框架,包含:(1)Gain-Projected Scaling(GPS)通过泰勒级数展开量化激活-权重量化的缩放增益,从而通过求导推导出最优缩放因子,以缓解通道级离群值。(2)静态标记级量化(STWQ)利用ARVG的固有属性——固定标记长度和跨样本的位置不变分布——在不增加动态校准开销的前提下解决标记级方差。(3)分布导向校准(DGC)选择对分布熵贡献最大的样本,以消除样本级分布不匹配。大量实验表明,PTQ4ARVG能够有效地将ARVG系列模型量化至8位和6位,同时保持竞争的性能。代码已公开于 http://github.com/BienLuky/PTQ4ARVG。
引用
@article{arxiv.2601.21238,
title = {PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models},
author = {Xuewen Liu and Zhikai Li and Jing Zhang and Mengjuan Chen and Qingyi Gu},
journal= {arXiv preprint arXiv:2601.21238},
year = {2026}
}
备注
ICLR 2026