中文

基于学习提示引导的数据生成的视觉转换器联合后训练量化

计算机视觉与模式识别 2026-02-24 v1

摘要

我们提出了一个面向图像分类的Vision Transformer后训练量化框架。不同于先前的后训练或分块重构方法,我们在无需任何标注数据的情况下,对所有层和跨块依赖关系进行联合优化,能够有效扩展样本数量,仅用单张GPU即可在ViT-small模型上完成优化。我们在ImageNet数据集上实现了最先进的W4A4和W3A3精度,在已知视角下,首次在ViT、DeiT和Swin-T模型下以极低比特设置(W1.58A8)下保持良好精度,展示了在边缘设备部署中的潜力。进一步,我们引入了一种数据无关的校准策略,通过学习的多模式提示引导Stable Diffusion Turbo合成出多样化、无标签的样本。通过鼓励学习提示嵌入和生成图像特征中的多样性,我们的数据无关方法在与真实ImageNet校准数据相当的性能上超越了简单文本提示基线,如"a <形容词> photo of <形容词> <类别>"。

关键词

引用

@article{arxiv.2602.18861,
  title  = {Joint Post-Training Quantization of Vision Transformers with Learned Prompt-Guided Data Generation},
  author = {Shile Li and Markus Karmann and Onay Urfalioglu},
  journal= {arXiv preprint arXiv:2602.18861},
  year   = {2026}
}