基于分布鲁棒优化理解对比学习
机器学习
2023-10-18 v1 人工智能
摘要
本研究揭示了对比学习(CL)对采样偏差的固有容忍性,其中负样本可能包含相似语义(例如标签)。然而,现有理论难以解释这一现象。我们通过分布鲁棒优化(DRO)的视角分析CL,弥合了这一研究空白,并得出若干关键见解:(1)CL本质上是对负采样分布进行DRO,从而在各种潜在分布上实现鲁棒性能,并表现出对采样偏差的鲁棒性;(2)温度 的设计并非仅是启发式的,而是充当拉格朗日系数,调节潜在分布集合的大小;(3)在DRO与互信息之间建立了理论联系,从而为“InfoNCE作为MI的估计”提供了新的证据,以及一种基于 散度的广义互信息的新估计方法。我们还识别了CL的潜在缺陷,包括过度保守和对离群值敏感,并引入了一种新颖的Adjusted InfoNCE损失(ADNCE)来缓解这些问题。它细化了潜在分布,提升了性能并加速收敛。在多个领域(图像、句子和图)上的大量实验验证了所提方法的有效性。代码见 \url{https://github.com/junkangwu/ADNCE}。
引用
@article{arxiv.2310.11048,
title = {Understanding Contrastive Learning via Distributionally Robust Optimization},
author = {Junkang Wu and Jiawei Chen and Jiancan Wu and Wentao Shi and Xiang Wang and Xiangnan He},
journal= {arXiv preprint arXiv:2310.11048},
year = {2023}
}