面向视觉Transformer的块相似性感知无数据量化
计算机视觉与模式识别
2023-01-06 v3
摘要
视觉Transformer近来在各种计算机视觉任务上取得了巨大成功;然而,其高模型复杂度使得在资源受限设备上部署颇具挑战。量化是降低模型复杂度的有效方法,而无数据量化能够解决模型部署过程中的数据隐私与安全问题,已受到广泛关注。遗憾的是,所有现有方法(如BN正则化)均为卷积神经网络设计,无法应用于架构差异显著的视觉Transformer。本文提出PSAQ-ViT,一种面向视觉Transformer的块相似性感知无数据量化框架,基于视觉Transformer的独特性质生成“真实”样本以校准量化参数。具体而言,我们分析了自注意力模块的性质,揭示了其在处理高斯噪声与真实图像时普遍存在的一种差异(块相似性)。上述洞察引导我们设计相对值度量来优化高斯噪声以逼近真实图像,随后将其用于校准量化参数。我们在多个基准上进行了大量实验与消融研究,验证了PSAQ-ViT的有效性,其甚至可超越真实数据驱动的方法。代码见:https://github.com/zkkli/PSAQ-ViT。
引用
@article{arxiv.2203.02250,
title = {Patch Similarity Aware Data-Free Quantization for Vision Transformers},
author = {Zhikai Li and Liping Ma and Mengjuan Chen and Junrui Xiao and Qingyi Gu},
journal= {arXiv preprint arXiv:2203.02250},
year = {2023}
}
备注
ECCV 2022