SiNGER:从更清晰的声音出发,进一步蒸馏视觉 Transformer
计算机视觉与模式识别
2026-03-04 v4 人工智能
摘要
视觉 Transformer 作为视觉基础模型的 backbone 被广泛采用,但它们已知会产生高范数 artifacts,导致表示质量下降。当知识蒸馏将这些特征传递给学生时,高范数 artifacts 会主导目标函数,导致学生过拟合 artifacts 并对信息信号的权重不足,削弱了更大模型的收益。先前的工作尝试消除 artifacts,但遇到了在抑制 artifacts 与保留教师信息信号之间天然权衡的挑战。为此,我们引入Singular Nullspace-Guided Energy Reallocation(奇异零空间引导能量重新分配),这是一种新颖的蒸馏框架,旨在抑制 artifacts 同时保留信息信号。其核心思想是对教师特征进行原则性的细化:在细化过程中,我们利用零空间引导的扰动,在抑制 artifacts 的同时保留信息。随后,对细化后的教师特征进行蒸馏。我们通过 LoRA-based adapter 实现了该扰动,仅需最小结构修改。大量实验表明,\oursname 持续地改进学生模型,在多个下游任务中实现了最先进的性能,并产生更清晰、更具可解释性的表示.
引用
@article{arxiv.2509.20986,
title = {SiNGER: A Clearer Voice Distills Vision Transformers Further},
author = {Geunhyeok Yu and Sunjae Jeong and Yoonyoung Choi and Jaeseung Kim and Hyoseok Hwang},
journal= {arXiv preprint arXiv:2509.20986},
year = {2026}
}
备注
Main paper: 12 pages (including 3 pages of references), 6 figures, 6 tables. Appendix: 9 pages, 7 figures. ICLR 2026 accepted