中文

对于自监督学习,理性意味着可证明的泛化

机器学习 2020-10-19 v1 神经与进化计算 机器学习

摘要

我们证明了以下分类器泛化差距的一个新上界:该分类器先利用自监督学习得到训练数据的一种表示 rr,再对标签拟合一个简单(如线性)分类器 gg。具体而言,我们表明(在如下所述的假设下)若 C(g)n\mathsf{C}(g) \ll n,则此类分类器的泛化差距趋于零,其中 C(g)\mathsf{C}(g) 为简单分类器 gg 复杂度的恰当定义度量,nn 为训练样本数。我们强调,我们的界与表示 rr 的复杂度无关。我们对表示学习任务不作任何结构或条件独立假设,该任务可使用随后用于分类的同一训练数据集。相反,我们假设训练过程满足某些自然的噪声鲁棒性(加入少量标签噪声导致性能小幅退化)与理性(得到错误标签不优于完全无标签)条件,这些条件广泛成立于许多标准架构中。我们表明,我们的界对于 CIFAR-10 与 ImageNet 上许多流行的基于表示学习的分类器(包括 SimCLR、AMDIM 与 MoCo)是非平凡的。

关键词

引用

@article{arxiv.2010.08508,
  title  = {For self-supervised learning, Rationality implies generalization, provably},
  author = {Yamini Bansal and Gal Kaplun and Boaz Barak},
  journal= {arXiv preprint arXiv:2010.08508},
  year   = {2020}
}