理解非线性自监督学习的表示可学习性
机器学习
2024-01-09 v1 人工智能
摘要
自监督学习 (SSL) 已在许多下游任务中实证展示了其数据表示可学习性。关于数据表示可学习性的理论工作寥寥无几,且大多关注最终数据表示,将非线性神经网络视为“黑盒”。然而,神经网络的精确学习结果对于描述 SSL 模型所学到的数据分布特征至关重要。本文首次精确分析了非线性 SSL 模型的学习结果。我们考虑一个包含两个特征的玩具数据分布:与标签相关的特征和隐藏特征。与依赖闭式解的先前线性设置工作不同,我们使用梯度下降算法在特定初始化区域内训练一个单层非线性 SSL 模型,并证明该模型收敛到局部极小值。此外,不同于复杂的迭代分析,我们提出了一种新的分析过程,利用反函数定理的精确形式来准确描述局部极小值所学到的特征。基于此局部极小值,我们证明了非线性 SSL 模型可以同时捕捉与标签相关的特征和隐藏特征。相比之下,非线性监督学习 (SL) 模型只能学习与标签相关的特征。我们还通过模拟实验展示了非线性 SSL 和 SL 模型的学习过程和结果。
引用
@article{arxiv.2401.03214,
title = {Understanding Representation Learnability of Nonlinear Self-Supervised Learning},
author = {Ruofeng Yang and Xiangyuan Li and Bo Jiang and Shuai Li},
journal= {arXiv preprint arXiv:2401.03214},
year = {2024}
}