Correct-N-Contrast:一种提升对伪相关鲁棒性的对比学习方法
机器学习
2024-12-12 v2
摘要
伪相关对鲁棒机器学习构成重大挑战。采用经验风险最小化(ERM)训练的模型可能学会依赖类标签与伪属性之间的相关性,从而在缺乏这些相关性的数据组上表现不佳。当伪属性标签不可用时,该问题尤为棘手。为在无训练属性标签的情况下改善伪相关数据上的最差组性能,我们提出Correct-N-Contrast(CNC),一种直接学习对伪相关鲁棒表示的对比方法。由于ERM模型可以是良好的伪属性预测器,CNC通过以下方式工作:(1)利用训练好的ERM模型输出识别具有相同类别但伪特征不相似的样本;(2)使用对比学习训练鲁棒模型,使同类样本获得相似表示。为支持CNC,我们建立了最差组误差与CNC旨在最小化的表示对齐损失之间的新联系。我们通过实验观察到最差组误差与对齐损失紧密跟踪,并证明某类上的对齐损失有助于上界该类的最差组与平均误差差距。在流行基准上,CNC大幅降低对齐损失,并以平均绝对提升3.6%取得state-of-the-art最差组准确率。CNC在与需要组标签的oracle方法相比中也具竞争力。
引用
@article{arxiv.2203.01517,
title = {Correct-N-Contrast: A Contrastive Approach for Improving Robustness to Spurious Correlations},
author = {Michael Zhang and Nimit S. Sohoni and Hongyang R. Zhang and Chelsea Finn and Christopher Ré},
journal= {arXiv preprint arXiv:2203.01517},
year = {2024}
}
备注
38 pages, 14 figures. ICML 2022 Long Talk