中文

PSAQ-ViT V2:面向视觉 Transformer 的准确通用无数据量化

计算机视觉与模式识别 2023-08-01 v2

摘要

无数据量化有可能解决模型压缩中的数据隐私与安全问题,因此已被广泛研究。近来,PSAQ-ViT 设计了相对值度量——块相似度,从预训练的视觉 Transformer(ViTs)生成数据,实现了 ViTs 无数据量化的首次尝试。本文提出 PSAQ-ViT V2,一种基于 PSAQ-ViT 构建的更准确且通用的 ViTs 无数据量化框架。更具体地,沿用 PSAQ-ViT 中的块相似度度量,我们引入自适应师生策略,在全精度模型(教师)监督下,以竞争与交互方式促进生成样本与量化模型(学生)的持续循环演化,从而显著提升量化模型的精度。此外,在无辅助类别引导的情况下,我们采用与任务和模型无关的先验信息,使通用方案兼容广泛的视觉任务与模型。在图像分类、目标检测和语义分割任务上的多种模型进行了大量实验,PSAQ-ViT V2 采用朴素量化策略且无需访问真实数据,始终取得有竞争力的结果,显示出作为 ViTs 无数据量化强大基线的潜力。例如,以 Swin-S 为(骨干)模型,8 位量化在 ImageNet 上达到 82.13 top-1 精度,在 COCO 上达到 50.9 box AP 和 44.1 mask AP,在 ADE20K 上达到 47.2 mIoU。我们希望准确且通用的 PSAQ-ViT V2 能作为涉及敏感数据的实际应用中的潜在且实用的解决方案。代码已发布并合并于:https://github.com/zkkli/PSAQ-ViT。

关键词

引用

@article{arxiv.2209.05687,
  title  = {PSAQ-ViT V2: Towards Accurate and General Data-Free Quantization for Vision Transformers},
  author = {Zhikai Li and Mengjuan Chen and Junrui Xiao and Qingyi Gu},
  journal= {arXiv preprint arXiv:2209.05687},
  year   = {2023}
}

备注

Accepted by TNNLS 2023