中文

SpatialFormer:面向小样本学习的语义与目标感知注意力

计算机视觉与模式识别 2024-07-18 v2

摘要

近期的小样本学习(FSL)方法侧重于生成具有判别力的嵌入特征,以精确度量支持集与查询集之间的相似性。当前基于 CNN 的交叉注意力方法通过增强支持与查询样本对中语义相似区域来生成判别性表示。然而,它存在两个问题:CNN 结构基于局部特征产生不准确的注意力图,且相互相似的背景造成干扰。为缓解这些问题,我们设计了一种新颖的 SpatialFormer 结构,以基于全局特征生成更准确的注意力区域。不同于导致 FSL 中精度下降的传统 Transformer 对实例级内在相似性的建模,我们的 SpatialFormer 探索成对输入间的语义级相似性以提升性能。随后我们推导出两个特定的注意力模块,名为 SpatialFormer 语义注意力(SFSA)与 SpatialFormer 目标注意力(SFTA),以增强目标物体区域并减少背景干扰。具体而言,SFSA 高亮成对特征间具有相同语义信息的区域,SFTA 寻找与基类别相似的新颖特征中的潜在前景物体区域。大量实验表明我们的方法有效,并在小样本分类基准上取得了新的 SOTA 结果。

关键词

引用

@article{arxiv.2303.09281,
  title  = {SpatialFormer: Semantic and Target Aware Attentions for Few-Shot Learning},
  author = {Jinxiang Lai and Siqian Yang and Wenlong Wu and Tao Wu and Guannan Jiang and Xi Wang and Jun Liu and Bin-Bin Gao and Wei Zhang and Yuan Xie and Chengjie Wang},
  journal= {arXiv preprint arXiv:2303.09281},
  year   = {2024}
}