InfoNCE 损失可证明地学习保持簇的表示
机器学习
2023-02-17 v1
摘要
对比学习的目标是学习一种表示,通过将具有相似内容(例如狗的“狗性”)的样本在表示所生成的空间中彼此靠近来保持底层簇。解决这一无监督学习问题的一个常见且成功的方法是最小化与训练样本相关的 InfoNCE 损失,其中每个样本与其增强样本(正样本,如旋转、裁剪)以及一批负样本(不相关样本)相关联。据我们所知,通过最小化 InfoNCE 损失学习的表示是否保持底层数据簇一直未得到解答,因为它仅促进学习忠实于增强的表示,即图像与其增强具有相同的表示。我们的主要结果是证明,在负样本数量有限的情况下,InfoNCE 学习的表示对于数据中的簇也是一致的,条件是簇内的增强集可以不重叠但彼此接近且交织,相对于学习函数类的复杂度而言。
引用
@article{arxiv.2302.07920,
title = {InfoNCE Loss Provably Learns Cluster-Preserving Representations},
author = {Advait Parulekar and Liam Collins and Karthikeyan Shanmugam and Aryan Mokhtari and Sanjay Shakkottai},
journal= {arXiv preprint arXiv:2302.07920},
year = {2023}
}