基于ViT-ProtoNet的少样本图像分类:多基准评估
计算机视觉与模式识别
2025-07-15 v1 人工智能
机器学习
摘要
Vision Transformer(ViT)在少样本图像分类中的表现突出,但在实际应用中仍被 underutilize。本文引入ViT-ProtoNet,将ViT-Small主干网络集成到Prototypical Network框架中。通过对少量支持样本的类条件token嵌入进行平均,ViT-ProtoNet构建鲁棒的原型,能够在5-shot设置下泛化到新类别。我们在四个标准基准上进行了广泛的经验评估:Mini-ImageNet、FC100、CUB-200和CIFAR-FS,包括重叠支持变体以评估鲁棒性。在所有分割上,ViT-ProtoNet consistently优于基于CNN的Prototypical Network等价方法,在5-shot准确率上提升最高可达3.2%,并在潜在空间展现出优异的特征可分性。此外,它在更轻量级主干网络上优于或与基于Transformer的竞争方法相当。进行了全面的消融实验,考察Transformer深度、patch大小和fine-tuning策略的影响。为促进可重复性,我们发布了代码和预训练权重。我们的结果将ViT-ProtoNet确立为少样本分类的强大且灵活的方法,为基于Transformer的meta-learner树立了新的基准。
引用
@article{arxiv.2507.09299,
title = {ViT-ProtoNet for Few-Shot Image Classification: A Multi-Benchmark Evaluation},
author = {Abdulvahap Mutlu and Şengül Doğan and Türker Tuncer},
journal= {arXiv preprint arXiv:2507.09299},
year = {2025}
}
备注
All codes are available at https://github.com/abdulvahapmutlu/vit-protonet