面向少样本学习的Transformer中属性代理学习与谱令牌池化
计算机视觉与模式识别
2022-03-18 v1 人工智能
机器学习
摘要
本文提出新的分层级联Transformer,可通过属性代理学习和谱令牌池化提高数据效率。视觉Transformer近来被视为卷积神经网络用于视觉识别的有前景的替代方案。但在数据不足时,其陷入过拟合并表现出较差性能。为提高数据效率,我们提出分层级联Transformer,通过谱令牌池化利用固有图像结构,并通过潜在属性代理优化可学习参数。固有图像结构通过谱令牌池化用于减少前景内容与背景噪声间的模糊性。属性代理学习方案旨在利用图像-标签对中的丰富视觉信息,而非由其标签分配的简单视觉概念。我们称为HCTransformers的分层级联Transformer构建于自监督学习框架DINO之上,并在数个流行的少样本学习基准上测试。在归纳设置下,HCTransformers在miniImageNet上以9.7%的5-way 1-shot准确率和9.17%的5-way 5-shot准确率大幅超越DINO基线,表明HCTransformers能高效提取判别性特征。此外,HCTransformers在四个流行基准数据集(包括miniImageNet、tieredImageNet、FC100和CIFAR-FS)上的5-way 1-shot和5-way 5-shot设置中均较SOTA少样本分类方法具有明显优势。训练权重和代码可在https://github.com/StomachCold/HCTransformers获取。
引用
@article{arxiv.2203.09064,
title = {Attribute Surrogates Learning and Spectral Tokens Pooling in Transformers for Few-shot Learning},
author = {Yangji He and Weihan Liang and Dongyang Zhao and Hong-Yu Zhou and Weifeng Ge and Yizhou Yu and Wenqiang Zhang},
journal= {arXiv preprint arXiv:2203.09064},
year = {2022}
}
备注
To appear in CVPR 2022, codes are released at https://github.com/StomachCold/HCTransformers