Siamese Transformer 网络用于少样本图像分类
计算机视觉与模式识别
2024-08-06 v1 人工智能
摘要
人类在视觉分类任务中展现出显著的能力,能够以极少的样本准确识别和分类新图像。这种能力归因于他们聚焦细节并在已见图像与新图像之间识别共同特征的能力。相比之下,现有的少样本图像分类方法往往侧重于全局特征或局部特征,很少有研究考虑两者的整合。为弥补这一不足,我们提出了一种基于 Siamese Transformer 网络(STN)的新方法。我们的方法采用两个并行分支网络,分别利用预训练的 Vision Transformer(ViT)架构提取全局特征和局部特征。具体而言,我们实现了 ViT-Small 网络架构,并通过自监督学习获取预训练模型参数来初始化分支网络。我们对全局特征施加欧氏距离度量,对局部特征施加 Kullback-Leibler(KL)散度度量。为整合两种度量,我们首先进行 L2 归一化,然后对归一化结果加权以获得最终相似度分数。该策略同时利用全局和局部特征的优势并确保它们的互补效益。在训练阶段,我们采用元学习方法对整个网络进行微调。我们的策略有效利用了全局和局部特征在少样本图像分类中的潜力,避免了复杂的特征适应模块并增强了模型的泛化能力。大量实验表明,我们的框架简单而有效,在四个流行的少样本分类基准上,在 5-shot 和 1-shot 场景下均优于现有最先进基线。
引用
@article{arxiv.2408.01427,
title = {Siamese Transformer Networks for Few-shot Image Classification},
author = {Weihao Jiang and Shuoxi Zhang and Kun He},
journal= {arXiv preprint arXiv:2408.01427},
year = {2024}
}
备注
12 pages