中文

卷积旁路是更优的视觉 Transformer 适配器

计算机视觉与模式识别 2022-08-10 v3

摘要

预训练然后微调的范式已在计算机视觉中被广泛采用。但随着 Vision Transformer(ViT)规模呈指数级增长,考虑到更重的存储开销,全量微调变得难以承受。受语言 transformer 上参数高效迁移学习(PETL)的启发,近期研究尝试向预训练 ViT 中插入轻量适配模块(例如适配器层或提示 token),仅微调这些模块而冻结预训练权重。然而,这些模块最初是为微调语言模型提出的,并未考虑针对视觉任务的先验知识。在本文中,我们提出在 ViT 中构建卷积旁路(Convpass)作为适配模块,仅引入少量(少于模型参数的 0.5%)可训练参数来适配大型 ViT。与其他 PETL 方法不同,Convpass 受益于卷积层硬编码的归纳偏置,因此更适合视觉任务,尤其是在低数据场景下。在 VTAB-1K 基准和少样本学习数据集上的实验结果表明,Convpass 优于当前面向语言的适配模块,证明了为适配视觉模型定制面向视觉的适配模块的必要性。

关键词

引用

@article{arxiv.2207.07039,
  title  = {Convolutional Bypasses Are Better Vision Transformer Adapters},
  author = {Shibo Jie and Zhi-Hong Deng},
  journal= {arXiv preprint arXiv:2207.07039},
  year   = {2022}
}