中文

面向通用类别发现的光谱可解释性与增强变换器 SIEFormer

计算机视觉与模式识别 2026-02-16 v1

摘要

本文提出一种新方法,光谱可解释性与增强变换器(SIEFormer),其利用谱分析重新解释视觉变换器(ViT)中的注意力机制,并增强特征的适应性,尤其强调对具有挑战性的通用类别发现(GCD)任务。 proposed SIEFormer 由两个主要分支构成,分别对应 ViT 的隐式与显式光谱视角,实现联合优化。隐式分支通过使用不同类型的图拉普拉斯算子来建模 token 的局部结构相关性,并提出一种新型的波段自适应滤波层(Band-adaptive Filter, BaF),能够灵活实现带通与带阻滤波。显式分支则引入可调滤波层(Maneuverable Filtering Layer, MFL),通过对输入“值”特征应用傅里叶变换来学习 token 之间的全局依赖关系,将变换后的信号与一组可学习的频域参数调制,然后进行逆傅里叶变换以获得增强后的特征。大量实验表明,在多个图像识别数据集上实现了最先进的性能,through ablation studies and visualizations 进一步确认了我们方法的优越性。

关键词

引用

@article{arxiv.2602.13067,
  title  = {SIEFormer: Spectral-Interpretable and -Enhanced Transformer for Generalized Category Discovery},
  author = {Chunming Li and Shidong Wang and Tong Xin and Haofeng Zhang},
  journal= {arXiv preprint arXiv:2602.13067},
  year   = {2026}
}