中文

抽样偏差的起源:公平性测度与缓解的影响

机器学习 2025-03-25 v1

摘要

准确测量歧视现象对于忠实地评估训练有监督机器学习(ML)模型的公平性至关重要。任何对歧视测度的偏差都会导致对现有差异的放大或低估。多个偏差来源存在,人们假设机器学习产生的偏差由不同群体(例如女性与男性、白人与黑人等)均匀地“出生”。然而,如果偏差由不同群体以不同方式“出生”,则可能加剧对特定亚群体的歧视。特别是,抽样偏差在文献中被用于描述抽样程序导致的偏差,然而其使用不加以区分。本文尝试通过引入明确定义的抽样偏差变体来消除这一术语的模糊性,具体包括样本大小偏差(SSB)和欠代表偏差(URB)。通过在基准数据集上进行大量实验并采用主流学习算法,我们暴露出在几种模型训练场景中的相关观察。最终,我们将这些观察归纳为面向实践者的可操作性建议。

关键词

引用

@article{arxiv.2503.17956,
  title  = {On the Origins of Sampling Bias: Implications on Fairness Measurement and Mitigation},
  author = {Sami Zhioua and Ruta Binkyte and Ayoub Ouni and Farah Barika Ktata},
  journal= {arXiv preprint arXiv:2503.17956},
  year   = {2025}
}