超越最终层:用于视觉 Transformer 的注意力多层融合
计算机视觉与模式识别
2026-01-15 v1
摘要
随着大规模基础模型的兴起,如何高效地将其适配到下游任务仍然是一个核心挑战。线性探测冻结骨干网络并训练一个轻量级头部,在计算上很高效,但通常局限于最后一层的表示。我们表明,与任务相关的信息分布在整个网络层次结构中,而不是仅仅编码在最后几层中。为了利用这种信息分布,我们应用了一种注意力探测机制,动态融合 Vision Transformer 所有层的表示。该机制学习识别目标任务最相关的层,并将低层结构线索与高层语义抽象相结合。在 20 个不同的数据集和多个预训练基础模型上,我们的方法比标准线性探测取得了一致且显著的提升。注意力热图进一步揭示,与预训练领域不同的任务从中间层表示中获益最多。总体而言,我们的发现强调了中间层信息的价值,并展示了一种有原则的、任务感知的方法,以在基于探测的适配中释放其潜力。
引用
@article{arxiv.2601.09322,
title = {Beyond the final layer: Attentive multilayer fusion for vision transformers},
author = {Laure Ciernik and Marco Morik and Lukas Thede and Luca Eyring and Shinichi Nakajima and Zeynep Akata and Lukas Muttenthaler},
journal= {arXiv preprint arXiv:2601.09322},
year = {2026}
}