中文

自监督学习中最优数据增强的理论刻画

机器学习 2025-06-10 v4

摘要

数据增强在自监督学习(SSL)近期取得的成功中发挥了重要作用。虽然增强通常被认为是在学习到的表征中编码不同视图之间的不变性,但这一解释忽略了预训练架构的影响,并暗示SSL需要类似于数据的多样化增强才能有效工作。然而,这些假设与经验证据不符,促使我们进一步从理论上理解以指导新领域中增强的合理设计。为此,我们利用核理论推导了在预训练后实现期望目标表征的数据增强的解析表达式。我们考虑了非对比损失和对比损失,即VICReg、Barlow Twins和谱对比损失,并提供了一个构造此类增强的算法。我们的分析表明,增强不必类似于数据也不必多样化即可学习有用的表征,并且架构对最优增强有显著影响。

关键词

引用

@article{arxiv.2411.01767,
  title  = {A Theoretical Characterization of Optimal Data Augmentations in Self-Supervised Learning},
  author = {Shlomo Libo Feigin and Maximilian Fleissner and Debarghya Ghoshdastidar},
  journal= {arXiv preprint arXiv:2411.01767},
  year   = {2025}
}