SVD-ViT:奇异值分解是否使 Vision Transformer 更关注前景?
计算机视觉与模式识别
2026-02-10 v2
摘要
Vision Transformer(ViT)已被确立为大规模基础模型。然而,由于自注意力机制是全局的,它缺乏明确的前景与背景区分机制。结果,ViT 可能学习不必要的背景特征和伪影,导致分类性能下降。为解决此问题,我们提出 SVD-ViT,利用奇异值分解(SVD)优先学习前景特征。SVD-ViT 包含三个组件——SPC 模块、SSVA 和 ID-RSVD——通过提取和聚合捕获对象前景信息的奇异向量,抑制任务无关因素,如背景噪声和伪影。实验结果表明,我们的方法提高了分类准确率,有效学习了信息丰富的前景表示,同时减少了背景噪声的影响。
引用
@article{arxiv.2602.02765,
title = {SVD-ViT: Does SVD Make Vision Transformers Attend More to the Foreground?},
author = {Haruhiko Murata and Kazuhiro Hotta},
journal= {arXiv preprint arXiv:2602.02765},
year = {2026}
}
备注
I corrected the incorrect email address. I'm sorry for any inconvenience this may have caused