中文

以几何调和应对表征学习失衡

机器学习 2023-10-27 v1

摘要

自监督学习(SSL)作为一种有效的表征学习范式,已在多样场景下的多个精选数据集上取得巨大成功。然而,面对真实应用中的长尾分布,现有方法仍难以捕捉可迁移且鲁棒的表征。传统 SSL 方法追求样本级均匀性,易导致表征学习失衡,即头部类主导特征空间而尾部类被动坍缩。为解决此问题,我们提出一种新颖的几何调和(GH)方法,以鼓励表征学习中的类别级均匀性,该方式对少数类更为友好,且在长尾分布下几乎不损害多数类。具体而言,GH 在自监督学习之上度量嵌入空间的总体统计,进而推断细粒度实例级校准,以约束头部类的空间扩张并避免尾部类的被动坍缩。我们的方案不改变 SSL 设定,且能以低成本方式轻松集成到现有方法中。在一系列基准数据集上的广泛结果表明,GH 对分布偏斜具有高容忍度的有效性。我们的代码见 https://github.com/MediaBrain-SJTU/Geometric-Harmonization。

关键词

引用

@article{arxiv.2310.17622,
  title  = {Combating Representation Learning Disparity with Geometric Harmonization},
  author = {Zhihan Zhou and Jiangchao Yao and Feng Hong and Ya Zhang and Bo Han and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2310.17622},
  year   = {2023}
}

备注

Accepted to NeurIPS 2023 (spotlight)