中文

改进视觉Transformer用于增量学习

计算机视觉与模式识别 2022-04-19 v3

摘要

本文提出了一种在类增量学习中使用视觉Transformer(ViT)的实用方案。尽管该方案仅组合了现有技术,但开发这一组合并非易事。首先,在增量学习中朴素地用ViT替代卷积神经网络(CNNs)会导致严重的性能下降。其次,我们明确了朴素使用ViT的三个问题:(a)当类别数较少时ViT收敛非常缓慢,(b)与基于CNN的架构相比,ViT对新类表现出更大的偏向,(c)ViT的传统学习率过低,无法学习出良好的分类器层。最后,我们的解决方案名为ViTIL(ViT for Incremental Learning),在所有三种类增量学习设定下,于CIFAR和ImageNet数据集上均以明显优势取得了新的最先进水平(state-of-the-art)。我们相信这推进了增量学习领域对transformer的认识。代码将公开发布。

关键词

引用

@article{arxiv.2112.06103,
  title  = {Improving Vision Transformers for Incremental Learning},
  author = {Pei Yu and Yinpeng Chen and Ying Jin and Zicheng Liu},
  journal= {arXiv preprint arXiv:2112.06103},
  year   = {2022}
}

备注

Add experiments on CIFAR-100, comparison with DER