中文

CLAMP-ViT:面向 ViT 自适应后训练量化的对比数据无监督学习

计算机视觉与模式识别 2024-09-10 v2 人工智能 图像与视频处理

摘要

我们提出 CLAMP-ViT,一种针对视觉转换网络 (ViT) 的数据无监督后训练量化方法。我们识别了最近技术的局限性,尤其是其无法利用有意义的 patch 间关系,导致生成简单且语义模糊的数据,从而影响量化准确率。CLAMP-ViT 采用两阶段方法,循环适应数据生成和模型量化。具体而言,我们引入 patch 级别的对比学习方案,以生成更丰富、语义更具意义的数据。此外,我们在 layer-wise 进化搜索中利用对比学习进行 fixed-和 mixed-precision 量化,以识别最优量化参数,同时减轻非光滑损失景观的影响。广泛的评估显示,CLAMP-ViT 在各种视觉任务上的优势,分类准确率提升最高可达 3%,目标检测的 mAP 提升 0.6,分割的 mIoU 提升 1.5,在相同或更好的压缩比下相较于现有方法表现更佳。代码已公开 https://github.com/georgia-tech-synergy-lab/CLAMP-ViT.git

关键词

引用

@article{arxiv.2407.05266,
  title  = {CLAMP-ViT: Contrastive Data-Free Learning for Adaptive Post-Training Quantization of ViTs},
  author = {Akshat Ramachandran and Souvik Kundu and Tushar Krishna},
  journal= {arXiv preprint arXiv:2407.05266},
  year   = {2024}
}

备注

ECCV 2024