中文

对比学习中表征损害与分配损害的研究

机器学习 2023-10-04 v1 机器学习

摘要

在监督学习场景中,少数群体代表性不足对其性能的影响已被公认为一个严重问题;然而,在自监督学习(SSL)背景下,该问题迄今未被充分探索。本文表明,作为SSL一种流行变体的对比学习(CL)倾向于将少数群体与某些多数群体的表征坍缩在一起。我们将此现象称为表征损害,并使用相应的流行CL方法在图像和文本数据集上予以证明。此外,我们对下游分类任务中分配损害的因果中介分析揭示,表征损害对其负有部分责任,从而强调了研究和缓解表征损害的重要性。最后,我们利用随机块模型为表征损害提供了理论解释,该模型在对比学习设定下会导致表征神经坍缩。

关键词

引用

@article{arxiv.2310.01583,
  title  = {An Investigation of Representation and Allocation Harms in Contrastive Learning},
  author = {Subha Maity and Mayank Agarwal and Mikhail Yurochkin and Yuekai Sun},
  journal= {arXiv preprint arXiv:2310.01583},
  year   = {2023}
}