中文

FAIRLABEL:纠正标签中的偏差

机器学习 2023-11-02 v1 人工智能

摘要

已有若干算法用于衡量机器学习模型的公平性。这些方法的一个基本假设是真实标签是公平或无偏的。然而,在现实世界数据集中,真实标签常包含由历史和社会偏见及歧视所导致的数据。在这些数据集上训练的模型会将偏差继承并传播至模型输出。我们提出FAIRLABEL,一种检测并纠正标签中偏差的算法。FAIRLABEL的目标是降低各组间的差异影响(DI),同时保持预测的高准确率。我们提出衡量偏差纠正质量的指标,并在合成数据集上验证FAIRLABEL,显示标签纠正正确率达86.7%,而基线模型为71.9%。我们还将FAIRLABEL应用于UCI Adult、German Credit Risk和Compas等基准数据集,显示差异影响比提升高达54.2%。

关键词

引用

@article{arxiv.2311.00638,
  title  = {FAIRLABEL: Correcting Bias in Labels},
  author = {Srinivasan H Sengamedu and Hien Pham},
  journal= {arXiv preprint arXiv:2311.00638},
  year   = {2023}
}

备注

ICDM LegalAI Workshop 2023