中文

基于任务内互注意力的视觉Transformer小样本学习

计算机视觉与模式识别 2024-05-07 v1

摘要

人类在仅接触少量样本后,就能准确分类新的未见图像,这种能力源于他们能够识别新图像与先前图像之间的共同特征,同时忽略背景变化等干扰。然而,对于人工神经网络模型,在有限样本下确定区分两张图像最相关的特征是一个挑战。本文提出一种用于小样本学习的任务内互注意力方法,该方法将支持集和查询集样本分割成块,并使用预训练的Vision Transformer (ViT)架构进行编码。具体来说,我们在支持集和查询集之间交换类别(CLS)标记和块标记以实现互注意力,从而使每个集关注最有用的信息。这有助于加强类内表示,并促进同一类实例之间更接近。在实现上,我们采用基于ViT的网络架构,并利用通过自监督获得的预训练模型参数。通过将掩码图像建模作为自监督训练任务进行预训练,预训练模型产生语义有意义的表示,同时成功避免了监督崩溃。然后我们采用元学习方法微调最后几层和CLS标记模块。我们的策略显著减少了需要微调的参数数量,同时有效利用了预训练模型的能力。大量实验表明,我们的框架简单、有效且计算高效,在五个流行的小样本分类基准上,在5-shot和1-shot场景下均取得了优于最先进基线的性能。

关键词

引用

@article{arxiv.2405.03109,
  title  = {Intra-task Mutual Attention based Vision Transformer for Few-Shot Learning},
  author = {Weihao Jiang and Chang Liu and Kun He},
  journal= {arXiv preprint arXiv:2405.03109},
  year   = {2024}
}