利用小投影器与多视图实现高效视觉预训练
机器学习
2025-01-20 v2 人工智能
计算机视觉与模式识别
摘要
自监督 (SSL) 视觉表征学习的近期进展催生了若干不同框架的提出,这些框架依赖于图像增强但使用不同的损失函数。然而,目前缺乏有理论依据的原则来指导实践,因此每个 SSL 框架的实际实现都需要若干启发式方法才能实现有竞争力的性能。在本工作中,我们基于近期的分析结果,为具有竞争力且高效的 SSL 设计了有理论依据的实用建议。具体而言,近期理论告诉我们,现有的 SSL 框架都在最小化同一个理想化损失,即学习最能匹配由所用增强定义的数据相似度核的特征。我们展示了如何将该理想化损失重新表述为计算上更高效的函数等价损失。我们研究了使用梯度下降最小化我们重新表述的损失函数的隐式偏差,发现使用更强的正交化约束并降低投影器维度应能产生良好的表征。此外,理论表明,通过增加增强数量应能改进对重新表述损失的近似,因此使用多重增强应能带来更好的收敛。我们在 CIFAR、STL 和 Imagenet 数据集上实证验证了我们的发现,其中我们展示了使用我们基于理论的建议训练 ResNet 主干时,线性读出性能得到了提升。值得注意的是,我们还展示了通过利用这些见解,我们可以仅通过使用更多数据增强,将预训练数据集大小减少多达 2,同时保持下游准确率。总而言之,我们的工作提供了有理论依据的建议,可用于改进 SSL 的收敛性和效率。
引用
@article{arxiv.2312.10725,
title = {Harnessing small projectors and multiple views for efficient vision pretraining},
author = {Kumar Krishna Agrawal and Arna Ghosh and Shagun Sodhani and Adam Oberman and Blake Richards},
journal= {arXiv preprint arXiv:2312.10725},
year = {2025}
}
备注
Accepted to NeurIPS 2024