探索视觉Transformer的高效少样本自适应方法
计算机视觉与模式识别
2023-01-09 v1
摘要
少样本学习(FSL)任务旨在借助从具有丰富标注训练样本的基础类别中学到的知识,对仅含少量标注样本的新类别进行推断。尽管已有大量工作研究FSL任务,视觉Transformer(ViTs)很少作为FSL的骨干网络,仅有少数尝试聚焦于对整个骨干或分类层的朴素微调。本质上,尽管ViTs已在其他视觉任务中展现出可比甚至更优的性能,在真实FSL场景中高效微调ViTs仍非常困难。为此,我们提出一种新颖的高效Transformer调优(eTT)方法,以促进FSL任务中ViTs的微调。其核心创新在于分别为任务和骨干调优新提出的注意力前缀调优(APT)与域残差适配器(DRA)。具体而言,在APT中,前缀被投影为新的键和值对,并附加到每个自注意力层,为模型提供任务特定信息。此外,我们以可学习偏移向量的形式设计DRA,以处理基础数据与新颖数据之间潜在的域差距。为确保APT不会过度偏离初始任务特定信息,我们进一步提出一种新颖的原型正则化,其最大化前缀投影分布与初始原型之间的相似性,从而正则化更新过程。我们的方法在具有挑战性的Meta-Dataset上取得了优异性能。我们进行了大量实验以展示模型的有效性。
引用
@article{arxiv.2301.02419,
title = {Exploring Efficient Few-shot Adaptation for Vision Transformers},
author = {Chengming Xu and Siqian Yang and Yabiao Wang and Zhanxiong Wang and Yanwei Fu and Xiangyang Xue},
journal= {arXiv preprint arXiv:2301.02419},
year = {2023}
}