中文

Fair-OBNC:纠正带公平性标签噪声的方法

机器学习 2024-10-15 v2

摘要

自动决策系统(如机器学习模型)所使用的数据常常反映过去的歧视行为。这些训练数据中的偏见有时与标签噪声有关,例如在 COMPAS 中,更多的非裔美国人被错误地标记为风险更高的再犯者,而与其白人同僕相比。在此类带偏见的数据上训练的模型可能加剧或甚至加剧对敏感信息(如性别、种族或年龄)的偏见。然而,尽管文献中有多种标签噪声校正方法,但这些方法仅关注模型性能。在本工作中,我们提出了 Fair-OBNC,一种具有公平性考虑的标签噪声校正方法,以产生可衡量人口统计学公平性的训练数据集。所提方法改进了基于排序的噪声校正技术,依据基于集成误差边际和观察人口统计学公平性潜在增加量的调整后的排序准则。我们在受控标签噪声的不同情景下,对 Fair-OBNC 与其他不同的预处理技术进行评估。我们的结果表明,所提方法在标签校正方法中整体更优,能够更好地重建原始标签。在噪声标签数据上训练的模型平均提升了 150% 的人口统计学公平性,跨所考虑的标签噪声水平。

关键词

引用

@article{arxiv.2410.06214,
  title  = {Fair-OBNC: Correcting Label Noise for Fairer Datasets},
  author = {Inês Oliveira e Silva and Sérgio Jesus and Hugo Ferreira and Pedro Saleiro and Inês Sousa and Pedro Bizarro and Carlos Soares},
  journal= {arXiv preprint arXiv:2410.06214},
  year   = {2024}
}