MimiQ:面向视觉 Transformer 的低位数据免除量化及其在 Head 注意力相似性方面的优势
机器学习
2025-04-15 v4 人工智能
计算机视觉与模式识别
摘要
数据免除量化 (DFQ) 是一种从其全精度对应体制中创建轻量级网络的方法,无需原始训练数据,通常通过合成数据集实现。虽然已提出了多个 DFQ 方法用于视觉 transformer (ViT) 架构,但在低位设置下未能实现有效性。考察现有方法后,我们发现其合成数据产生的注意力图与真实样本的注意力图高度错位。受此启发,我们发现 aligning 合成数据的注意力图有助于提高量化 ViT 的整体性能。基于此发现,我们构思 MimiQ,一个专为 ViT 设计的 novel DFQ 方法,以增强 inter-head 注意力相似性。首先,通过 aligning 每个空间查询 patch 的 head-wise 注意力输出生成合成数据。随后,通过应用 head-wise 结构注意力蒸馏,将量化网络的注意力图与全精度教师的注意力图对齐。实验结果表明,所提方法显著优于基线方法,为 ViT-DFQ 树立了 new state-of-the-art。本文是我们已在 AAAI 2025 会议论文集中发表的工作的扩展版本,包含额外的补充材料。
引用
@article{arxiv.2407.20021,
title = {MimiQ: Low-Bit Data-Free Quantization of Vision Transformers with Encouraging Inter-Head Attention Similarity},
author = {Kanghyun Choi and Hye Yoon Lee and Dain Kwon and SunJong Park and Kyuyeun Kim and Noseong Park and Jonghyun Choi and Jinho Lee},
journal= {arXiv preprint arXiv:2407.20021},
year = {2025}
}
备注
Published to AAAI 2025