基于近似充分统计量的对比学习统计理论
机器学习
2025-10-15 v2 机器学习
统计理论
统计理论
摘要
对比学习——一种通过训练模型区分相似样本与不相似样本来从无标签数据中提取有用表示的方法——在基础模型中取得了显著进展。在本工作中,我们为分析基于数据增强的对比学习(以 SimCLR 为代表性示例)开发了新的理论框架。我们的ethods 基于“近似充分统计量”的概念,这一概念我们将其扩展自 2025 年的原始定义,用于对比学习语言-图像预训练 (CLIP),并使用 KL 散度。我们将其推广为等效形式和通用 f-divergences,并表明最小化 SimCLR 和其他对比损失会产生近似充分的编码器。进一步,我们展示这些近似充分的编码器可以有效地适应下游回归和分类任务,其性能取决于其充分性以及对比学习中数据增强引入的误差。提供线性回归和主题分类的具体示例,以说明其广泛适用性。
引用
@article{arxiv.2503.17538,
title = {A Statistical Theory of Contrastive Learning via Approximate Sufficient Statistics},
author = {Licong Lin and Song Mei},
journal= {arXiv preprint arXiv:2503.17538},
year = {2025}
}