中文

面向小样本Transformer的自提升监督

计算机视觉与模式识别 2022-06-10 v2

摘要

视觉Transformer(ViTs)的小样本学习能力虽被强烈需求却鲜有研究。本工作中,我们经实证发现,在相同的少样本学习框架下(如Meta-Baseline),将以广泛使用的CNN特征提取器替换为ViT模型常会严重损害少样本分类性能。此外,我们的实证研究表明,在缺乏归纳偏置时,ViTs在仅有少量有标签训练数据可用的少样本学习机制下常学到低质量的token依赖,这很大程度上导致了上述性能退化。为缓解该问题,我们首次提出一种简单而有效的ViT少样本训练框架,即自提升监督(Self-promoted sUpervisioN, SUN)。具体而言,除用于全局语义学习的常规全局监督外,SUN进一步在少样本学习数据集上预训练ViT,然后用其生成个体位置特定监督以引导每个patch token。该位置特定监督告知ViT哪些patch token相似或不相似,从而加速token依赖学习。此外,它对每个patch token中的局部语义建模以提升目标定位与识别能力,有助于学习可泛化模式。为提升位置特定监督的质量,我们进一步提出两种技术:1)背景patch过滤,将背景patch滤除并归入额外的背景类;2)空间一致增强,在保持所生成局部监督准确性的同时引入充足多样性进行数据增强。实验结果表明,使用ViT的SUN显著超越其他基于ViT的少样本学习框架,且是首个取得高于CNN最优方法性能的方案。

关键词

引用

@article{arxiv.2203.07057,
  title  = {Self-Promoted Supervision for Few-Shot Transformer},
  author = {Bowen Dong and Pan Zhou and Shuicheng Yan and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2203.07057},
  year   = {2022}
}

备注

Code is available at https://github.com/DongSky/few-shot-vit