中文

面向持续敏感变量的公平性分组:应用于肤色去偏面孤立分析

机器学习 2025-07-16 v1

摘要

在法律框架下,公平性通常通过将观察值划分为预定义组并计算公平性度量(例如就性别而言的Disparate Impact或Equality of Odds)来评估数据集和模型。然而,当敏感属性如肤色为连续值时,将其划分为默认组可能会忽视或掩盖某些少数子人群所经历的歧视。为解决这一局限性,我们提出了一种用于连续(可能是多维的)敏感属性的公平性分组方法。通过根据观察到的歧视水平对数据进行分组,该方法识别出最大化基于歧视组间方差的新颖准则的分区,从而隔离最关键的子组。我们使用多个合成数据集验证了所提出的方法,并展示了其在分布变化下的鲁棒性——揭示了敏感属性空间中歧视的呈现方式。此外,我们考察了单调公平性的特殊情况,即肤色。我们的经验结果显示,在CelebA和FFHQ上,利用来自工业级专有算法的预测肤色,我们的分段方法揭示了比以前报告的更细致的歧视模式,并且这些发现在给定模型的数据集之间保持稳定。最后,我们利用我们的分组模型进行去偏处理,旨在对各组进行后处理以预测公平得分。结果表明,我们的方法在保持准确性的同时提高了公平性,从而证明了我们的分区方法的有效性,为工业部署打开了大门。

关键词

引用

@article{arxiv.2507.11246,
  title  = {Generative Click-through Rate Prediction with Applications to Search Advertising},
  author = {Lingwei Kong and Lu Wang and Changping Peng and Zhangang Lin and Ching Law and Jingping Shao},
  journal= {arXiv preprint arXiv:2507.11246},
  year   = {2025}
}

备注

This work was first submitted on February 9, 2024