中文

剥洋葱:面向高效视觉Transformer训练的数据冗余分层约简

计算机视觉与模式识别 2022-11-22 v1 人工智能 机器学习

摘要

视觉Transformer(ViT)近期在许多应用中取得成功,但其在训练和推理时的密集计算与高内存占用限制了其泛化能力。以往的压缩算法通常从预训练的稠密模型出发且只关注高效推理,而耗时的训练仍不可避免。相反,本文指出百万规模训练数据存在冗余,这是训练繁琐的根本原因。为解决该问题,本文旨在将数据稀疏化,并提出一个从三个稀疏视角出发的端到端高效训练框架,称为三级高效ViT(Tri-Level E-ViT)。具体而言,我们利用分层数据冗余约简方案,通过探索三个层面的稀疏性:数据集中的训练样本数、每个样本中的图像块(token)数,以及位于注意力权重中的 token 间连接数。通过大量实验,我们证明所提技术能在保持精度的同时显著加速多种 ViT 架构的训练。值得注意的是,在特定比例下,我们能够提升 ViT 精度而非牺牲它。例如,在 Deit-T 上我们以 72.6%(+0.4)的 Top-1 精度实现 15.2% 的加速,在 Deit-S 上以 79.9%(+0.1)的 Top-1 精度实现 15.7% 的加速。这证明了 ViT 中数据冗余的存在。

关键词

引用

@article{arxiv.2211.10801,
  title  = {Peeling the Onion: Hierarchical Reduction of Data Redundancy for Efficient Vision Transformer Training},
  author = {Zhenglun Kong and Haoyu Ma and Geng Yuan and Mengshu Sun and Yanyue Xie and Peiyan Dong and Xin Meng and Xuan Shen and Hao Tang and Minghai Qin and Tianlong Chen and Xiaolong Ma and Xiaohui Xie and Zhangyang Wang and Yanzhi Wang},
  journal= {arXiv preprint arXiv:2211.10801},
  year   = {2022}
}

备注

AAAI 2023