中文

从线性到非线性:遮蔽自编码器如何捕获空间相关性

计算机视觉与模式识别 2025-08-25 v1

摘要

遮蔽自编码器(MAEs)已成为视觉基础模型的强大预训练技术。尽管其有效性显而易见,但在应用于新数据集时需要 extensive 的超参数调优(遮蔽比例、补丁大小、编码器/解码器层数)。虽然已有理论工作分析了MAEs的注意力模式和层次潜变量模型,但MAE的超参数与下游任务性能之间的联系相对不为人知。本文研究了MAE如何学习输入图像中的空间相关性。我们对线性MAE进行解析推导,展示遮蔽比例和补丁大小可用于选择捕获短程和长程空间相关性的特征。我们将这一分析扩展到非线性MAE,表明MAE表示会适应数据集中的空间相关性,超越二阶统计。最后,我们讨论了在实际中选择MAE超参数的一些见解。

关键词

引用

@article{arxiv.2508.15404,
  title  = {From Linearity to Non-Linearity: How Masked Autoencoders Capture Spatial Correlations},
  author = {Anthony Bisulco and Rahul Ramesh and Randall Balestriero and Pratik Chaudhari},
  journal= {arXiv preprint arXiv:2508.15404},
  year   = {2025}
}