通过 RKHS 逼近与回归理解基于数据增强的自监督表示学习
机器学习
2024-01-19 v3 机器学习
摘要
数据增强对于现代自监督表示学习(如对比学习和掩码语言建模)的经验成功至关重要。然而,对数据增强确切作用的理论理解仍然有限。近期工作建立了自监督学习与图 Laplacian 算子顶部特征空间逼近之间的联系,表明在此类表示之上学习线性探针可与 RKHS 回归相关联。基于这一洞察,本工作深入探讨了基于数据增强预训练的统计分析。从等距性质(即由数据增强给出的目标函数的几何刻画)出发,我们解开了模型与数据增强的影响,并证明了两个与模型复杂度无关的泛化界。我们的第一个界适用于任意编码器,其中预测误差被分解为通过 RKHS 回归拟合线性探针所产生的估计误差,以及 RKHS 逼近所引发的逼近误差之和。我们的第二个界专门针对编码器接近最优的情形,即它逼近由数据增强诱导的 RKHS 的前 d 维特征空间。我们分析中的一个关键要素是数据增强复杂度,我们用它来定量比较不同的数据增强并分析其对下游性能的影响。
引用
@article{arxiv.2306.00788,
title = {Understanding Augmentation-based Self-Supervised Representation Learning via RKHS Approximation and Regression},
author = {Runtian Zhai and Bingbin Liu and Andrej Risteski and Zico Kolter and Pradeep Ravikumar},
journal= {arXiv preprint arXiv:2306.00788},
year = {2024}
}
备注
ICLR 2024 spotlight. 34 pages