隐藏或推断:面向未知人口统计信息的公平学习排序
机器学习
2024-07-25 v1 计算机与社会
摘要
随着学习排序模型在具有重大生活影响的问题中广泛应用,公平机器学习社区正在开发公平学习排序(LTR)模型。这些模型依赖于种族或性别等敏感人口统计特征的 availability。然而实际情况下,监管障碍和隐私 concerns 保护这些数据不得不收集和使用。结果,实践者可能需要在缺乏这些特征的情况下促进公平性,或依赖人口统计推断工具试图推断这些特征。鉴于这些工具不可靠,本文旨在进一步了解人口统计推断错误如何影响流行公平 LTR 策略的公平性。在何种情况下应该隐藏这些人口统计属性而不是推断它们?我们检验了一系列公平 LTR 策略,从包含隐藏或推断的人口统计特征的公平 LTR 到无公平性考虑的 LTR 后置公平重排序。我们进行受控实证研究,通过系统性扰动推断的敏感属性来建模不同的推断错误水平。我们还对三个真实数据集和流行开源推断方法进行案例研究。我们的发现表明,随着推断噪声的增加,纳入公平性考虑的 LTR 方法可能增加偏差。相比之下,公平重排序策略对推断误差更稳健。我们实验研究的所有源代码、数据和实验制品均可在此处获取:https://github.com/sewen007/hoiltr.git
引用
@article{arxiv.2407.17459,
title = {Hidden or Inferred: Fair Learning-To-Rank with Unknown Demographics},
author = {Oluseun Olulana and Kathleen Cachel and Fabricio Murai and Elke Rundensteiner},
journal= {arXiv preprint arXiv:2407.17459},
year = {2024}
}
备注
This paper has been accepted by AAAI/AIES to the AIES 2024 conference