中文

CAIT:面向 ViT 的高精度、快推理与良好可迁移性的三赢压缩方法

计算机视觉与模式识别 2025-10-20 v2

摘要

Vision Transformers (ViTs) 近来已成为各类视觉任务的最先进模型。然而,其沉重的计算成本对资源受限设备而言仍令人望而却步。为此,研究者致力于压缩 ViT 中的冗余信息以加速。然而,现有方法通常通过 token 剪枝稀疏丢弃冗余图像 token,或通过通道剪枝粗暴移除通道,导致模型性能与推理速度之间的次优平衡。此外,当将压缩模型迁移至需要图像空间结构的下游视觉任务(如语义分割)时,它们表现不佳。为解决这些问题,我们提出 CAIT,一种 ViT 的联合压缩方法,实现了高准确率、快推理速度与对下游任务良好可迁移性的和谐融合。具体而言,我们引入非对称 token 合并(ATME)策略以有效整合相邻 token,它能在压缩冗余 token 信息的同时保留图像空间结构。在此基础上,我们进一步设计一致动态通道剪枝(CDCP)策略,以动态剪枝 ViT 中不重要的通道。得益于 CDCP,ViT 多头自注意力模块中的不重要通道可被统一剪枝,显著增强模型压缩。在多个基准数据集上的大量实验表明,我们所提方法能在各类 ViT 上取得最先进性能。

关键词

引用

@article{arxiv.2309.15755,
  title  = {CAIT: Triple-Win Compression towards High Accuracy, Fast Inference, and Favorable Transferability For ViTs},
  author = {Ao Wang and Hui Chen and Zijia Lin and Sicheng Zhao and Jungong Han and Guiguang Ding},
  journal= {arXiv preprint arXiv:2309.15755},
  year   = {2025}
}

备注

TPAMI 2025 Camera-ready Version