中文

SVD-ViT:奇异值分解是否使 Vision Transformer 更关注前景?

计算机视觉与模式识别 2026-02-10 v2

摘要

Vision Transformer(ViT)已被确立为大规模基础模型。然而,由于自注意力机制是全局的,它缺乏明确的前景与背景区分机制。结果,ViT 可能学习不必要的背景特征和伪影,导致分类性能下降。为解决此问题,我们提出 SVD-ViT,利用奇异值分解(SVD)优先学习前景特征。SVD-ViT 包含三个组件——SPC 模块、SSVA 和 ID-RSVD——通过提取和聚合捕获对象前景信息的奇异向量,抑制任务无关因素,如背景噪声和伪影。实验结果表明,我们的方法提高了分类准确率,有效学习了信息丰富的前景表示,同时减少了背景噪声的影响。

关键词

引用

@article{arxiv.2602.02765,
  title  = {SVD-ViT: Does SVD Make Vision Transformers Attend More to the Foreground?},
  author = {Haruhiko Murata and Kazuhiro Hotta},
  journal= {arXiv preprint arXiv:2602.02765},
  year   = {2026}
}

备注

I corrected the incorrect email address. I'm sorry for any inconvenience this may have caused