中文

ViR:视觉储备池

计算机视觉与模式识别 2021-12-30 v2 机器学习

摘要

近一年来,视觉Transformer(ViT)在图像分类中的成功应用已得到见证。然而,仍有证据表明ViT常受以下两方面困扰:i)在大规模数据集上应用多层Transformer进行预训练所带来的高计算与内存负担,ii)在小型数据集上从头训练时的过拟合。为解决这些问题,本文提出一种新方法,即视觉储备池计算(ViR),用于图像分类,作为ViT的平行方案。通过将每幅图像分割为定长令牌序列,ViR构建了一个具有近全连接拓扑的纯储备池,以替换ViT中的Transformer模块。随后提出两种深度ViR模型以增强网络性能。在多个图像分类基准上进行了ViR与ViT的对比实验。无需任何预训练过程,ViR在模型复杂度和计算复杂度上均优于ViT。具体而言,ViR的参数数量约为ViT的15%甚至5%,内存占用约为ViT的20%至40%。ViR性能的优越性由小世界特性、Lyapunov指数和记忆容量加以解释。

关键词

引用

@article{arxiv.2112.13545,
  title  = {ViR:the Vision Reservoir},
  author = {Xian Wei and Bin Wang and Mingsong Chen and Ji Yuan and Hai Lan and Jiehuang Shi and Xuan Tang and Bo Jin and Guozhang Chen and Dongping Yang},
  journal= {arXiv preprint arXiv:2112.13545},
  year   = {2021}
}

备注

10 pages, 7 figures