中文

ViT-Linearizer:将二次知识蒸馏到线性时间视觉模型

计算机视觉与模式识别 2026-02-27 v2 人工智能

摘要

视觉转换器(ViT)通过全局自注意力机制取得了显著进展,但其二次复杂度在高分辨率输入上可能变得不可接受。本文提出ViT-Linearizer,一种跨架构蒸馏框架,将丰富的ViT表示知识蒸馏到线性时间、循环式模型中。我们的方法利用1)激活匹配,将学生模型的 token 级依赖与教师模型产生的依赖对齐,以及2)掩码预测,这一上下文重建目标要求学生模型预测未见(掩码)token的教师表示,从而在保持高效复杂度的同时,有效地将二次自注意力知识蒸馈到学生模型中。经验上,我们的方法在高分辨率任务方面显著提升了速度,有效缓解了推理中的硬件挑战。此外,它还提升了Mamba-based架构在标准视觉基准测试上的性能,在基座模型规模下实现了84.3%的top-1准确率。我们的结果凸显了基于RNN的解决方案在大规模视觉任务中的潜力,弥合了理论效率与实际应用之间的差距。

关键词

引用

@article{arxiv.2504.00037,
  title  = {ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models},
  author = {Guoyizhe Wei and Rama Chellappa},
  journal= {arXiv preprint arXiv:2504.00037},
  year   = {2026}
}