中文

注意力转移对视觉 Transformer 并非 universally effective

计算机视觉与模式识别 2026-05-11 v1 机器学习

摘要

最近的工作表明,注意力转移(Attention Transfer)仅通过从预训练教师视觉 Transformer (ViT) 转移注意力模式即可完全恢复教师预训练权重的全部效益。我们在20个来自11个著名ViT家族的教师上进行全面基准测试,发现注意力转移并非 universally effective。虽然7个家族成功传输,但4个家族始终失败,低于从零训练的 no-transfer 基线最高5.1%。进一步结果表明,这种失败在模型规模、训练时长、不同传输数据集以及外分布评估下均保持家族一致性。受控分析始终将问题局部化于注意力路由通道,表明关键问题不在于学生是否能匹配教师的注意力模式,而在于匹配到的模式对学生是否有效。关键地,我们识别出预训练教师与标准学生之间的架构不匹配为主要机制。仅通过在学生中添加教师的本机构件(以随机初始化状态),即可完全逆转所有4个家族的失败。值得注意的是,这些构件本身并不提高从零训练效果,确认它们特别地unlock了教师注意力的可用性。我们进一步系统性地表明,这种失败并非源于传输损失选择不当或预训练配方差异。我们的发现细化了对ViT表示中注意力的 prevailing understanding:注意力仅在学生架构匹配教师时才 sufficient。

关键词

引用

@article{arxiv.2605.07191,
  title  = {Attention Transfer Is Not Universally Effective for Vision Transformers},
  author = {Huaiyuan Qin and Muli Yang and Gabriel James Goenawan and Peng Hu and Chen Gong and Xi Peng and Hongyuan Zhu},
  journal= {arXiv preprint arXiv:2605.07191},
  year   = {2026}
}