视觉 Transformer 中非单调比例的机制
机器学习
2025-11-27 v1 人工智能
计算机视觉与模式识别
摘要
更深层的视觉 Transformer 常常表现不如较浅层的模型,这挑战了常见的比例假设。通过对 ViT-S、ViT-B 和 ViT-L 在 ImageNet 上的系统经验分析,我们识别出一种一致的 Cliff-Plateau-Climb 模式,决定了表示如何随深度演化。我们观察到,较好的性能与 [CLS] 标记逐渐边缘化(该标记原本设计为全局聚合枢纽)相对于 patch 标记分布共识有关。我们用信息混合指数 (Information Scrambling Index) 量化信息混合模式,显示在 ViT-L 中,信息-任务权衡大约在 10 层后于 ViT-B 才出现,且这些额外层与信息扩散增加相关,而非任务性能提升。综上,这些结果表明,在该 regimes 下的 Transformer 架构可能受益于精心校准的深度,以执行干净的相位转换,而非仅仅增加参数数量。信息混合指数为现有模型提供了有用的诊断工具,并为未来架构提供了潜在的设计目标。所有代码均可在 https://github.com/AnanthaPadmanaban-KrishnaKumar/Cliff-Plateau-Climb 获取。
关键词
引用
@article{arxiv.2511.21635,
title = {Mechanisms of Non-Monotonic Scaling in Vision Transformers},
author = {Anantha Padmanaban Krishna Kumar},
journal= {arXiv preprint arXiv:2511.21635},
year = {2025}
}
备注
16 pages total (11 pages main text, 1 pages references, 4 pages appendix), 5 figures, 11 tables. Code available at https://github.com/AnanthaPadmanaban-KrishnaKumar/Cliff-Plateau-Climb