利用余弦Transformer增强小样本图像分类
计算机视觉与模式识别
2023-07-24 v3
摘要
本文解决小样本图像分类问题,即仅给定少量带标签支持样本,对无标签查询样本执行分类任务。小样本学习问题的一个主要挑战是物体视觉外观的巨大多样性,使得支持样本无法全面代表该物体。这可能导致支持样本与查询样本之间的显著差异,从而削弱小样本算法的性能。本文中,我们提出小样本余弦Transformer(FS-CT)来解决该问题,其中支持样本与查询样本之间的关系映射被有效获取用于小样本任务。FS-CT由两部分组成:一个可学习的原型嵌入网络,用于从含困难样本的支持样本中获取类别表示;以及一个Transformer编码器,用于有效实现来自不同支持与查询样本的关系映射。我们引入余弦注意力(Cosine Attention),一种更鲁棒稳定的注意力模块,显著增强了Transformer模块,因此相比默认的缩放点积机制将FS-CT准确率从5%提升至超过20%。我们的方法在mini-ImageNet、CUB-200和CIFAR-FS上,于1-shot学习与5-shot学习任务中,跨主干网络与小样本配置均取得有竞争力的结果。我们还构建了一个用于瑜伽姿态识别的自定义小样本数据集,以展示算法在实际应用中的潜力。我们的带余弦注意力的FS-CT是一种轻量、简单的小样本算法,可应用于广泛场景,如医疗健康、医学与安全监控。我们的小样本余弦Transformer官方实现代码见https://github.com/vinuni-vishc/Few-Shot-Cosine-Transformer
引用
@article{arxiv.2211.06828,
title = {Enhancing Few-shot Image Classification with Cosine Transformer},
author = {Quang-Huy Nguyen and Cuong Q. Nguyen and Dung D. Le and Hieu H. Pham},
journal= {arXiv preprint arXiv:2211.06828},
year = {2023}
}