中文

QwT-v2:实用、有效且高效的训练后量化

计算机视觉与模式识别 2025-05-28 v1

摘要

网络量化可以说是减少现代深度神经网络庞大资源消耗的最实用的网络压缩方法之一。它们通常需要针对特定架构和任务做出多样且微妙的设计选择。相反,QwT方法是一种简单且通用的方法,它引入轻量级的附加结构来改进量化。但QwT会带来额外的参数和延迟。更重要的是,QwT与许多硬件平台不兼容。在本文中,我们提出了QwT-v2,它不仅享有QwT的所有优点,还解决了QwT的主要缺陷。通过采用非常轻量级的逐通道仿射补偿(CWAC)模块,与QwT相比,QwT-v2引入的额外参数和计算量显著减少,同时在准确率上持平甚至优于QwT。QwT-v2的补偿模块可以轻松集成到量化推理引擎中,这不仅有效消除了额外开销,还使其与大多数现有硬件平台兼容。

关键词

引用

@article{arxiv.2505.20932,
  title  = {QwT-v2: Practical, Effective and Efficient Post-Training Quantization},
  author = {Ningyuan Tang and Minghao Fu and Hao Yu and Jianxin Wu},
  journal= {arXiv preprint arXiv:2505.20932},
  year   = {2025}
}