中文

视觉 Transformer 的数据级彩票假设

计算机视觉与模式识别 2023-05-31 v3 机器学习

摘要

传统的彩票假设(LTH)声称,在稠密神经网络中存在一个稀疏子网络以及一种称为中奖票的恰当随机初始化方法,使得该子网络能从零开始训练到几乎与稠密网络相当的性能。同时,LTH 在视觉 Transformer(ViT)中的研究鲜有评估。在本文中,我们首先表明通过现有方法难以在 ViT 的权重层面找到传统中奖票。然后,受 ViT 输入依赖性的启发,我们将 ViT 的 LTH 推广到由图像块组成的输入数据。即,存在输入图像块的一个子集,使得 ViT 仅使用该子集块从零开始训练,即可达到与使用所有图像块训练的 ViT 相似的准确率。我们称该输入块子集为中奖票,其代表了输入数据中的大量信息。我们使用票选择器基于块的信息量对各种类型的 ViT 生成中奖票,包括 DeiT、LV-ViT 和 Swin Transformers。实验表明,用中奖票训练的模型与随机选取子集训练的模型性能存在明显差异,验证了我们所提出的理论。我们详细阐述了所提出的数据级 LTH-ViT 与传统 LTH 之间的类比相似性,以进一步验证理论的完整性。源代码可在 https://github.com/shawnricecake/vit-lottery-ticket-input 获取。

关键词

引用

@article{arxiv.2211.01484,
  title  = {Data Level Lottery Ticket Hypothesis for Vision Transformers},
  author = {Xuan Shen and Zhenglun Kong and Minghai Qin and Peiyan Dong and Geng Yuan and Xin Meng and Hao Tang and Xiaolong Ma and Yanzhi Wang},
  journal= {arXiv preprint arXiv:2211.01484},
  year   = {2023}
}

备注

Accepted by IJCAI 2023