何时能用神经正切核与主成分分析近似宽对比模型?
机器学习
2024-03-14 v1 机器学习
摘要
对比学习是一种从未标记数据中学习表征的范式,已在图像和文本数据上取得巨大成功。近期一些工作研究了对比损失,声称对比模型能有效学习谱嵌入,而少数工作揭示了(宽)对比模型与核主成分分析(PCA)之间的关系。然而,尚不清楚训练后的对比模型是否确实对应于核方法或 PCA。在这项工作中,我们分析具有非线性激活的两层对比模型的训练动力学,并回答这些模型何时接近 PCA 或核方法。在有监督设定中,众所周知神经网络等价于神经正切核(NTK)机器,且无限宽网络的 NTK 在训练期间保持不变。我们首次给出了对比损失的 NTK 收敛结果,并呈现了一幅细致入微的图景:对于基于余弦相似度的对比损失,宽网络的 NTK 几乎保持不变,但对于基于点积相似度的损失则不然。我们进一步研究了输出层具有正交性约束的对比模型的训练动力学,该约束在将对比学习与谱嵌入关联的工作中被隐式假设。我们的偏差界表明,对比模型学到的表征接近于由随机特征计算的某个矩阵的主成分。我们通过实验表明,我们的理论结果可能适用于两层以上的网络。
引用
@article{arxiv.2403.08673,
title = {When can we Approximate Wide Contrastive Models with Neural Tangent Kernels and Principal Component Analysis?},
author = {Gautham Govind Anil and Pascal Esser and Debarghya Ghoshdastidar},
journal= {arXiv preprint arXiv:2403.08673},
year = {2024}
}