中文

重新审视对比学习在域泛化中的理论

机器学习 2025-12-03 v1 机器学习 统计理论 统计理论

摘要

对比学习是自监督表示学习中最流行且最强大的方法之一,其目标是将语义相似的样本在潜在空间中映射得彼此接近,同时将不相似的样本分离开来。现有的理论方法假设下游任务的类别是从预训练阶段使用的相同潜在类别分布中抽取的。然而,在真实场景中,下游任务不仅可能在相同标签空间内表现出分布偏移,还可能引入新的或更广泛的标签空间,从而带来域泛化挑战。在本工作中,我们引入了新的泛化界,明确地考虑了这两种不匹配类型:域偏移和域泛化。具体而言,我们分析了下游任务要么(i)从相同的潜在类别空间中抽取类别但分布发生偏移,要么(ii)涉及预训练阶段未见过的新的标签空间。我们的分析揭示了对比学习表示的性能如何依赖于预训练与下游分布之间的统计差异。这种扩展的视角使我们能够为涉及预训练潜在类别集之外类别分布的平均分类任务中的学习表示性能提供可证明的保证。

关键词

引用

@article{arxiv.2512.02831,
  title  = {Revisiting Theory of Contrastive Learning for Domain Generalization},
  author = {Ali Alvandi and Mina Rezaei},
  journal= {arXiv preprint arXiv:2512.02831},
  year   = {2025}
}

备注

19 pages