视觉 Transformer 的自监督学习理论分析
机器学习
2025-02-06 v3 最优化与控制
机器学习
摘要
自监督学习已成为计算机视觉领域的基石,主要分为基于重建的方法(如掩码自编码器 MAE)和判别式方法(如对比学习 CL)。近期的经验观察表明,MAE 和 CL 捕获不同的表征类型:CL 倾向于关注全局模式,而 MAE 能同时有效捕获全局和细微的局部信息。尽管近期有大量经验研究旨在阐明这种差异,但理论理解仍有限,尤其是在主导架构——视觉 Transformer(ViT)上。本文为提供严谨的洞见,构建视觉数据分布模型,考虑两种空间特征:占主导地位的全局特征和相对微小的局部特征,并研究这些特征之间的不平衡问题。我们使用梯度下降分析了基于 Softmax 的单层 ViT 在 MAE 和 CL 目标下的训练动力学。我们的分析表明,随着特征不平衡程度的变化,使用 MAE 目标训练的 ViT 能有效学习全局和局部特征,以实现接近最优的重建,而 CL 训练的 ViT 偏好主要是全局特征,即使在轻微不平衡情况下亦如此。这些结果为经验研究中观察到的 MAE 和 CL 的不同行为提供了理论解释。
引用
@article{arxiv.2403.02233,
title = {A Theoretical Analysis of Self-Supervised Learning for Vision Transformers},
author = {Yu Huang and Zixin Wen and Yuejie Chi and Yingbin Liang},
journal= {arXiv preprint arXiv:2403.02233},
year = {2025}
}
备注
Accepted by ICLR 2025