对比学习的难负样本采样:最优表示几何与神经坍缩 vs 维度坍缩
机器学习
2025-05-08 v3
摘要
对于一个广泛研究的数据模型和一般的损失与样本硬化函数,我们证明有监督对比学习(SCL)、难样本 SCL(HSCL)和无监督对比学习(UCL)的损失被展现出神经坍缩(NC)的表示所最小化,即类均值构成等角紧框架(ETF)且同一类的数据被映射到相同表示。我们还证明对于任意表示映射,HSCL 和难样本 UCL(HUCL)损失的下界分别不低于对应的 SCL 和 UCL 损失。与现有文献不同,我们对 SCL 的理论结果不要求增广视图的类条件独立性,且适用于包含广泛使用的 InfoNCE 损失函数的一般损失函数类。此外,我们的证明更简洁、紧凑且透明。与现有文献类似,我们的理论断言在采用批量优化的实际场景中也成立。我们通过实验首次证明,若引入单位球或单位球面特征归一化,HSCL 和 HUCL 损失在随机初始化和合适硬度水平下通过 Adam 优化(含批量)确实可收敛到 NC 几何。然而,若不引入难负样本或特征归一化,通过 Adam 学习的表示会遭受维度坍缩(DC)且无法达到 NC 几何。这些结果例证了难负样本采样在对比表示学习中的作用,并以若干开放理论问题作结以供未来工作。代码见 https://github.com/rjiang03/HCL/tree/main
引用
@article{arxiv.2311.05139,
title = {Hard-Negative Sampling for Contrastive Learning: Optimal Representation Geometry and Neural- vs Dimensional-Collapse},
author = {Ruijie Jiang and Thuan Nguyen and Shuchin Aeron and Prakash Ishwar},
journal= {arXiv preprint arXiv:2311.05139},
year = {2025}
}
备注
Final version: Reviewed and accepted to TMLR April 2025. Updated exposition, Added analysis of lower bounds