基于 KNN Transformer 和金字塔提示的少样本学习
计算机视觉与模式识别
2024-10-15 v1
摘要
少样本学习(FSL)旨在识别有限标记数据中的新类别。近期研究尝试通过文本提示调制视觉特征以解决稀有样本问题,但通常难以捕获文本和视觉特征之间的复杂语义关系。此外,常规自注意力机制受图像中无用信息的影响,严重限制了语义先验在 FSL 中发挥的潜力,因为在交互期间会混淆大量无关标记。为此,提出一种基于 KNN Transformer 带金字塔提示的少样本学习方法(KTPP),通过 KNN 上下文注意力(KCA)选择判别性信息,并通过金字塔跨模态提示(PCP)适应性调制视觉特征。首先,对于每个标记,KCA 只选择最相关的 K 个标记来计算自注意力矩阵,并将所有标记的均值作为上下文提示,以在三个级联阶段中提供全局上下文。结果是,无关标记可以逐步被抑制。其次,在 PCP 中引入金字塔提示,通过文本基类感知提示与多尺度视觉特征之间的交互来强调视觉特征。这使 ViT 能够根据不同尺度上的丰富语义信息动态调整视觉特征的重要性权重,使模型对空间变化更具鲁棒性。最后,通过 KCA 与增强后的视觉特征和类感知提示进行交互,以提取类别特定特征。因此,我们的模型通过深层跨模态交互进一步增强无噪声视觉表征,在样本有限的场景中提取通用视觉表征。广泛的实验在四个基准数据集上证明了该方法的有效性。
引用
@article{arxiv.2410.10227,
title = {KNN Transformer with Pyramid Prompts for Few-Shot Learning},
author = {Wenhao Li and Qiangchang Wang and Peng Zhao and Yilong Yin},
journal= {arXiv preprint arXiv:2410.10227},
year = {2024}
}
备注
10 pages, 5 figures, accepted by ACM Multimedia 2024