中文

面向小样本类增量学习的语义-视觉引导Transformer

计算机视觉与模式识别 2023-03-29 v1

摘要

小样本类增量学习(FSCIL)近年来在多个领域引起了广泛关注。现有的FSCIL方法高度依赖于在基类上预训练的特征骨干网络的鲁棒性。近年来,不同的Transformer变体在众多领域的特征表示学习中取得了显著进展。然而,迄今为止Transformer在FSCIL场景中的进展尚未达到其他领域所展现的潜力。本文提出了一种语义-视觉引导Transformer(SV-T),以增强预训练特征骨干网络在增量类上的特征提取能力。具体而言,我们首先利用基类提供的视觉(图像)标签来监督Transformer的优化。然后,引入一个文本编码器,从基类中为每幅图像自动生成相应的语义(文本)标签。最后,所构建的语义标签被进一步应用于Transformer以引导其超参数更新。我们的SV-T能够充分利用来自基类的更多监督信息,并进一步增强特征骨干网络的训练鲁棒性。更重要的是,我们的SV-T是一种独立的方法,可直接应用于现有的FSCIL架构以获取各类增量类的嵌入。在三个基准、两种FSCIL架构和两种Transformer变体上的大量实验表明,与现有的最先进FSCIL方法相比,我们提出的SV-T取得了显著改进。

关键词

引用

@article{arxiv.2303.15494,
  title  = {Semantic-visual Guided Transformer for Few-shot Class-incremental Learning},
  author = {Wenhao Qiu and Sichao Fu and Jingyi Zhang and Chengxiang Lei and Qinmu Peng},
  journal= {arXiv preprint arXiv:2303.15494},
  year   = {2023}
}

备注

Accepted by IEEE International Conference on Multimedia and Expo (ICME 2023)