机器学习算法在人口学中的公平性
机器学习
2022-02-03 v1 人工智能
计算机与社会
摘要
本文致力于通过对俄罗斯人口数据集预测首次婚姻离婚、宗教信仰、首次就业与教育完成,研究该数据集的模型公平性与过程公平性。我们的目标是通过降低分类器对敏感特征的依赖,同时保持或至少维持其准确率,使分类器更公平。我们从基于神经的方法中的“dropout”技术获得启发,提出了一种使用“特征丢弃(feature drop-out)”以解决过程公平性的模型。为评估分类器公平性并决定需剔除的敏感特征,我们使用了“LIME 解释”。这由于特征丢弃产生了一个分类器池,其集成已被证明较少依赖敏感特征且对准确率有改善或无影响。我们的实证研究在四类分类器(逻辑回归、随机森林、Bagging 与 Adaboost)上进行,并基于真实数据集(源自 Generations and Gender Survey 的俄罗斯人口数据)开展,结果表明所有模型均降低了对敏感特征(如性别、首次伴侣关系破裂、首次伴侣关系等)的依赖,且在准确率上有所提升或无影响。
引用
@article{arxiv.2202.01013,
title = {Fairness of Machine Learning Algorithms in Demography},
author = {Ibe Chukwuemeka Emmanuel and Ekaterina Mitrofanova},
journal= {arXiv preprint arXiv:2202.01013},
year = {2022}
}
备注
This is an empirical replication study but with other demographic data. The theory and method description is heavily based on the arXiv:2006.10531