中文

FairJob:一个用于在线系统公平性的真实世界数据集

机器学习 2024-11-05 v2 人工智能 计算机与社会 机器学习

摘要

我们引入了一个面向广告中职位推荐的公平性感知数据集,旨在促进现实场景中算法公平性的研究。该数据集的收集和准备符合隐私标准和商业机密。一个额外的挑战是缺乏对受保护用户属性(如性别)的访问,为此我们提出了一种获取代理估计的解决方案。尽管数据集是匿名的并包含敏感属性的代理,但它保留了预测能力,并维持了一个现实且具有挑战性的基准。该数据集填补了高影响力领域(如广告)中公平性导向资源的显著空白——实际影响在于能否获得宝贵的就业机会,其中平衡公平性和效用是一个常见的工业挑战。我们还探讨了广告过程中可能发生不公平的各个阶段,并引入了一种方法,用于从有偏数据集中计算在线系统职位推荐的公平效用指标。在发布的数据集上对偏差缓解技术进行的实验评估证明了公平性的潜在改进以及相关的效用权衡。数据集托管在 https://huggingface.co/datasets/criteo/FairJob。实验源代码托管在 https://github.com/criteo-research/FairJob-dataset/。

关键词

引用

@article{arxiv.2407.03059,
  title  = {FairJob: A Real-World Dataset for Fairness in Online Systems},
  author = {Mariia Vladimirova and Federico Pavone and Eustache Diemert},
  journal= {arXiv preprint arXiv:2407.03059},
  year   = {2024}
}

备注

NeurIPS 2024, 28 pages, 15 figures