中文

SegQuant:面向扩散模型的语义感知通用量化框架

计算机视觉与模式识别 2026-03-17 v7 人工智能

摘要

扩散模型展现出卓越的生成能力,但计算密集,为在资源受限或延迟敏感的环境中部署带来了重大挑战。量化作为有效降低模型规模和计算成本的手段,后训练量化(PTQ)因其无需重新训练或使用训练数据即可与预训练模型兼容而尤为引人注目。然而,现有针对扩散模型的 PTQ 方法常依赖于特定于架构的启发式方法,限制了其通用性并阻碍了与工业部署管道的集成。为此,我们提出了 SegQuant,一个统一的量化框架,适度组合各种互补技术以增强跨模型的通用性。SegQuant 包含一种基于分段的、基于图的量化策略(SegLinear),捕获结构语义和空间异质性,以及一种双尺度量化方案(DualScale),保持极性非对称激活,这对于维持生成输出的视觉保真度至关重要。SegQuant 不仅适用于基于 Transformer 的扩散模型,还能在保持强大性能的同时,确保与主流部署工具的无缝兼容。

关键词

引用

@article{arxiv.2507.14811,
  title  = {SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models},
  author = {Jiaji Zhang and Ruichao Sun and Hailiang Zhao and Jiaju Wu and Peng Chen and Hao Li and Yuying Liu and Kingsum Chow and Gang Xiong and Shuiguang Deng},
  journal= {arXiv preprint arXiv:2507.14811},
  year   = {2026}
}

备注

22 pages, 15 figures, to be published in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026), code is available at https://github.com/OptiSys-ZJU/segquant