用于少样本学习的掩码引导视觉Transformer (MG-ViT)
计算机视觉与模式识别
2022-05-23 v1
摘要
少数据学习具有挑战性,但在标注数据有限且获取成本高的多种应用场景中往往不可避免。近来,少样本学习(FSL)因能将先验知识泛化至仅含少量样本的新任务而受到越来越多的关注。然而,对于视觉Transformer(ViT)等数据密集型模型,当前基于微调的 FSL 方法在知识泛化上效率低下,从而退化了下游任务性能。本文提出一种新颖的掩码引导视觉Transformer(MG-ViT),以在 ViT 模型上实现有效且高效的 FSL。其核心思想是对图像块施加掩码以筛除任务无关块,并在 FSL 过程中引导 ViT 关注任务相关且具有判别力的块。特别地,MG-ViT 仅引入一个额外的掩码操作与一条残差连接,使得能够继承预训练 ViT 的参数而无需其他任何代价。为最优选取具代表性的少样本,我们还纳入一种基于主动学习的样本选择方法,以进一步提升基于 MG-ViT 的 FSL 的泛化能力。我们在 Agri-ImageNet 分类任务与 ACFR 苹果检测任务上评估所提 MG-ViT,采用梯度加权类激活映射(Grad-CAM)作为掩码。实验结果表明,与基于常规微调的 ViT 模型相比,MG-ViT 模型显著提升了性能,为将数据密集型大规模深度学习模型泛化至 FSL 提供了新颖见解与具体途径。
引用
@article{arxiv.2205.09995,
title = {Mask-guided Vision Transformer (MG-ViT) for Few-Shot Learning},
author = {Yuzhong Chen and Zhenxiang Xiao and Lin Zhao and Lu Zhang and Haixing Dai and David Weizhong Liu and Zihao Wu and Changhe Li and Tuo Zhang and Changying Li and Dajiang Zhu and Tianming Liu and Xi Jiang},
journal= {arXiv preprint arXiv:2205.09995},
year = {2022}
}
备注
11 pages,4 figures, submitted to 36th Conference on Neural Information Processing Systems (NeurIPS 2022)