中文

通过 RKHS 逼近与回归理解基于数据增强的自监督表示学习

机器学习 2024-01-19 v3 机器学习

摘要

数据增强对于现代自监督表示学习(如对比学习和掩码语言建模)的经验成功至关重要。然而,对数据增强确切作用的理论理解仍然有限。近期工作建立了自监督学习与图 Laplacian 算子顶部特征空间逼近之间的联系,表明在此类表示之上学习线性探针可与 RKHS 回归相关联。基于这一洞察,本工作深入探讨了基于数据增强预训练的统计分析。从等距性质(即由数据增强给出的目标函数的几何刻画)出发,我们解开了模型与数据增强的影响,并证明了两个与模型复杂度无关的泛化界。我们的第一个界适用于任意编码器,其中预测误差被分解为通过 RKHS 回归拟合线性探针所产生的估计误差,以及 RKHS 逼近所引发的逼近误差之和。我们的第二个界专门针对编码器接近最优的情形,即它逼近由数据增强诱导的 RKHS 的前 d 维特征空间。我们分析中的一个关键要素是数据增强复杂度,我们用它来定量比较不同的数据增强并分析其对下游性能的影响。

关键词

引用

@article{arxiv.2306.00788,
  title  = {Understanding Augmentation-based Self-Supervised Representation Learning via RKHS Approximation and Regression},
  author = {Runtian Zhai and Bingbin Liu and Andrej Risteski and Zico Kolter and Pradeep Ravikumar},
  journal= {arXiv preprint arXiv:2306.00788},
  year   = {2024}
}

备注

ICLR 2024 spotlight. 34 pages