非对比自监督学习中预测头的作用机制
机器学习
2023-01-18 v3 机器学习
摘要
最近 Grill 等人令人惊讶地发现了 Bootstrap Your Own Latent(BYOL)方法,表明如果我们在网络中加入所谓的预测头,对比损失中的负项可以被移除。这开启了非对比自监督学习的研究。令人困惑的是,即使存在平凡的崩溃全局最优解,通过(随机)梯度下降训练的神经网络仍能学习到有竞争力的表示。这一现象是深度学习中隐式偏置的典型例子,目前仍鲜为人知。在本工作中,我们展示了关于非对比自监督学习的经验和理论发现。在经验上,我们发现当预测头初始化为单位矩阵且仅有其非对角项可训练时,尽管训练目标中仍存在平凡最优解,网络仍能学习到有竞争力的表示。在理论上,我们提出了一个框架来理解可训练但单位初始化的预测头的行为。在一个简单设定下,我们刻画了预测头的替代效应和加速效应。替代效应发生在某些神经元中较强特征的学习可通过更新预测头来替代其他神经元中这些特征的学习时。加速效应发生在被替代的特征能加速其他较弱特征的学习以防止其被忽略时。这两种效应使神经网络能够学习所有特征,而非仅专注于学习较强特征,这很可能是维度崩溃现象的原因。据我们所知,这也是首个使用带有可训练预测头和归一化的非线性神经网络的非对比方法的端到端优化保证。
引用
@article{arxiv.2205.06226,
title = {The Mechanism of Prediction Head in Non-contrastive Self-supervised Learning},
author = {Zixin Wen and Yuanzhi Li},
journal= {arXiv preprint arXiv:2205.06226},
year = {2023}
}
备注
88 pages, comments welcome