中文

无需插补的公平性:一种处理缺失值公平预测的决策树方法

机器学习 2022-04-15 v2 计算机与社会 信息论 math.IT 机器学习

摘要

我们研究利用含缺失值数据训练机器学习模型时的公平性问题。尽管文献中存在若干公平性干预方法,其中大多数需要以完整训练集作为输入。在实践中,数据可能有缺失值,且数据缺失模式可能依赖于群体属性(例如性别或种族)。简单地将现成公平学习算法应用于插补后的数据集可能导致不公平模型。本文首先从理论上分析使用插补数据集训练时歧视风险的不同来源。随后,我们提出一种基于决策树的集成方法,无需单独的插补与学习过程。具体而言,我们使用缺失作为属性(MIA)的方式训练树,无需显式插补,并优化一个公平性正则化目标函数。通过多个真实世界数据集上的实验,我们证明该方法优于应用于插补数据集的现有公平性干预方法。

关键词

引用

@article{arxiv.2109.10431,
  title  = {Fairness without Imputation: A Decision Tree Approach for Fair Prediction with Missing Values},
  author = {Haewon Jeong and Hao Wang and Flavio P. Calmon},
  journal= {arXiv preprint arXiv:2109.10431},
  year   = {2022}
}