中文

非对比自监督学习的双重视角

机器学习 2026-02-06 v3 人工智能

摘要

{\em stop gradient} 与 {\em exponential moving average} 迭代程序在非对比式自监督学习方法中常用于避免表示坍塌,在实际应用中表现优异。本报告从优化和动力系统的双重视角考察这些程序。我们表明,尽管它们{\em 不会}优化原始目标函数,或{\em 任何}其他光滑函数,却{\em 会}避免坍塌。紧随 Following\citet{Tian21} 的研究,但无需其证明中使用的任何额外假设,我们进一步从线性情形的动力系统视角表明,若不使用 stop gradient 或 exponential moving average,最小化原始目标函数{\em 总是}导致坍塌。相反,我们在该线性情形下明确描述了与这两种程序相关的动力系统的平衡点为参数空间中的代数 variety,并表明它们在一般情况下{\em 是}渐近稳定的。我们的理论发现通过使用真实数据和合成数据的经验实验进行了说明。

关键词

引用

@article{arxiv.2507.01028,
  title  = {Dual Perspectives on Non-Contrastive Self-Supervised Learning},
  author = {Jean Ponce and Basile Terver and Martial Hebert and Michael Arbel},
  journal= {arXiv preprint arXiv:2507.01028},
  year   = {2026}
}