探究投影头在表示学习中的益处
机器学习
2024-03-19 v1 计算机视觉与模式识别
摘要
获取高质量表示的一种有效技术是在训练期间在编码器顶部添加一个投影头,然后将其丢弃并使用投影前的表示。尽管这种技术已被证明在实践中有效,但其成功背后的原因却知之甚少。投影前的表示并未被损失函数直接优化,这引发了一个问题:是什么让它们更好?在这项工作中,我们对这个问题提供了严格的理论解答。我们首先检查了使用自监督对比损失训练的线性模型。我们揭示了训练算法的隐式偏差导致了逐层渐进式特征加权,即随着网络层数加深,特征变得愈发不均等。因此,较低层倾向于具有更归一化且更少特化的表示。我们从理论上刻画了此类表示更有益的场景,突出了数据增强与输入特征之间复杂的相互作用。此外,我们证明在网络中引入非线性使得较低层能够学习到较高层中完全缺失的特征。最后,我们展示了该机制如何提升监督对比学习和监督学习中的鲁棒性。我们通过在 CIFAR-10/100、UrbanCars 和 ImageNet 偏移版本上的各种实验对结果进行了实证验证。我们还引入了一种投影头的潜在替代方案,它提供了更具可解释性和可控性的设计。
引用
@article{arxiv.2403.11391,
title = {Investigating the Benefits of Projection Head for Representation Learning},
author = {Yihao Xue and Eric Gan and Jiayi Ni and Siddharth Joshi and Baharan Mirzasoleiman},
journal= {arXiv preprint arXiv:2403.11391},
year = {2024}
}