非对比自监督学习中的隐式方差正则化
机器学习
2023-10-30 v2 人工智能
神经与进化计算
摘要
BYOL 和 SimSiam 等非对比自监督学习(SSL)方法依赖非对称预测器网络,以在无负样本的情况下避免表示坍缩。然而,预测器网络如何促进稳定学习尚未被完全理解。先前的理论分析假设了欧几里得损失,而大多数实际实现依赖余弦相似度。为获得对非对比 SSL 的进一步理论洞见,我们在闭式线性预测器网络的特征空间中解析地研究了结合欧几里得与余弦相似度的学习动态。我们表明,二者虽通过不同的动态机制,但均通过隐式方差正则化避免坍缩。此外,我们发现特征值充当有效的学习率乘数,并提出了一族各向同性损失函数(IsoLoss),以均衡各特征模式间的收敛速率。在经验上,IsoLoss 加速了初始学习动态并增强了鲁棒性,从而使我们能够摒弃非对比方法中通常使用的 EMA 目标网络。我们的分析阐明了非对比 SSL 的方差正则化机制,并为设计塑造预测器谱学习动态的新损失函数奠定了理论基础。
引用
@article{arxiv.2212.04858,
title = {Implicit variance regularization in non-contrastive SSL},
author = {Manu Srinath Halvagal and Axel Laborieux and Friedemann Zenke},
journal= {arXiv preprint arXiv:2212.04858},
year = {2023}
}
备注
Accepted at NeurIPS 2023