语义对齐与强化:面向视觉转换器的数据无数据量化
计算机视觉与模式识别
2025-11-03 v5
摘要
数据无数据量化(DFQ)使模型在不访问真实数据的情况下进行量化,解决了数据安全和隐私方面的顾虑。随着视觉转换器(ViT)的广泛应用,DFQ for ViT 受到广泛关注。然而,现有DFQ方法存在两个局限性:(1)语义失真,即合成图像的语义与真实图像之间存在显著偏差;(2)语义不足,导致合成图像包含大量内容有限、纹理过于简化的区域,从而导致量化性能次优。为此,我们提出了SARDFQ——一种面向视觉转换器的 novel 语义对齐与强化数据无数据量化方法。为解决语义失真问题,SARDFQ引入注意力先验对齐(APA),通过优化合成图像以遵循随机生成的结构注意力先验。为缓解语义不足问题,SARDFQ引入多语义强化(MSR),利用局部 patch 优化来增强合成图像上的语义丰富性。此外,SARDFQ采用软标签学习(SL),通过适应多个语义目标来促进由MSR增强的多语义图像学习。大量实验表明,SARDFQ的有效性显著优于现有方法。例如,SARDFQ在ImageNet上将W4A4 ViT-B的top-1准确率提高了15.52%。代码地址为https://github.com/zysxmu/SARDFQ。
引用
@article{arxiv.2412.16553,
title = {Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers},
author = {Yunshan Zhong and Yuyao Zhou and Yuxin Zhang and Wanchen Sui and Shen Li and Yong Li and Fei Chao and Rongrong Ji},
journal= {arXiv preprint arXiv:2412.16553},
year = {2025}
}
备注
ICCV2025