中文

Sebra:通过自引导偏置排序进行去偏

机器学习 2025-01-31 v1

摘要

通过对样本进行粗粒度的偏差性(spuriosity)程度排序(即存在虚假线索的程度)的做法,最近被证明在偏差缓解方面显著优于传统的二元偏好-无偏划分方法。然而,这种偏差性排序需要人工监督。本文提出了一个基于我们新颖的自我引导偏置排序(Sebra)框架的去偏方案,通过在各自类别内对数据点进行自动化的偏差性排序来缓解偏差。Sebra 利用经验风险最小化(ERM)训练中的一种关键局部对称性——通过 ERM 学习一个样本的难易程度与其虚假性呈反比;即,一个样本所包含的虚假线索越少,学习起来就越困难,反之亦然。然而,在迭代过程中,ERM 倾向于偏离这种对称性。Sebra 动态地引导 ERM 纠正这种偏离,促进按难度递增顺序学习属性,即按虚假性递减顺序学习。结果,Sebra 学习样本的顺序自然提供了虚假性排序。我们利用所得的细粒度偏差特征描述进行对比学习,以缓解来自多个来源的偏差。广泛的实验表明,Sebra 在 UrbanCars、BAR、CelebA 和 ImageNet-1K 等多个标准基准测试中持续优于以往最先进的无监督去偏技术。代码、预训练模型和训练日志均可在 https://kadarsh22.github.io/sebra_iclr25/ 获取。

关键词

引用

@article{arxiv.2501.18277,
  title  = {Sebra: Debiasing Through Self-Guided Bias Ranking},
  author = {Adarsh Kappiyath and Abhra Chaudhuri and Ajay Jaiswal and Ziquan Liu and Yunpeng Li and Xiatian Zhu and Lu Yin},
  journal= {arXiv preprint arXiv:2501.18277},
  year   = {2025}
}

备注

Accepted to ICLR 2025