中文

在Adult数据集上识别与检验机器学习偏差

计算机与社会 2023-10-17 v1 机器学习

摘要

本研究深入探讨通过集成学习(Ensemble Learning)降低机器学习模型偏差。我们严谨的方法全面评估了各类分类变量上的偏差,最终揭示出显著的性别属性偏差。经验证据揭示出基于性别的薪资预测差异:当性别属性切换为女性时,男性初始预测的薪资为$902.91,显著下降至$774.31。值得注意的是,Kullback-Leibler散度分数指向性别偏差,其值超过0.13,且主要出现在基于树的模型中。采用集成学习阐明了追求公平与透明的努力。有趣的是,我们的发现表明堆叠模型与个体模型一致,证实了模型偏差的韧性。本研究强调了伦理考量,并倡导在以公正与包容为特征的数据驱动社会中实施混合模型。

关键词

引用

@article{arxiv.2310.09373,
  title  = {Identifying and examining machine learning biases on Adult dataset},
  author = {Sahil Girhepuje},
  journal= {arXiv preprint arXiv:2310.09373},
  year   = {2023}
}