重新思考 MAE:基于线性时不变动力学
计算机视觉与模式识别
2026-05-05 v1 人工智能
摘要
标准的视觉模型表示探针依赖于数学上对称不变的操作,如全局平均池化(GAP)或 CLS 标记,将 patch 表示视为非结构化的单词包。我们挑战了这一范式,通过展示在冻结的视觉表示(如 MAE、BEiT、DINOv2 和 ViT 作为 CLS-ablation 极端)中,token 顺序是一个关键且可被利用的维度。我们提出 SSMProbe,一个由状态空间模型(SSM)驱动的探针框架。作为离散线性时不变(LTI)动力学系统,SSM 充当对称敏感的探针,其中序列顺序严格决定最终状态 due to 内在记忆衰减。将 token 排序建模为信息调度问题,我们比较固定扫描启发式方法与来自下游监督学习的可微软置换(基于 Sinkhorn 的方法)。在标准和细粒度分类基准测试上的评估揭示,惊人的顺序差距:固定扫描在高度局部化的 patch 特征上失败得很惨烈,而我们的学习软置换成功地从原本高度局部化的 patch 序列中提取出高度具竞争力的性能。我们发现,预训练目标根本塑造了 token 结构:DINOv2 将全局语义集中在优化后的 CLS 标记中,使 patch 高度专业化;纯 MAE 保持分布式表示,patch 信息性异质;ViT 表示一种受监督 CLS 主导的极端。BEiT 位于中间。这种异质性是顺序依赖的——即 SSM 探针的性能严格取决于哪些 token 放置在哪些时间位置——这不仅仅是空间网格的拓扑属性。SSMProbe 的学习路由有效地发现并利用了这种异质性,为视觉表示分析提供了强大的新诊断镜头。
引用
@article{arxiv.2605.00915,
title = {Rethink MAE with Linear Time-Invariant Dynamics},
author = {Zice Wang},
journal= {arXiv preprint arXiv:2605.00915},
year = {2026}
}