中文

公平预处理:理解机器学习流水线中数据转换器的组合公平性

机器学习 2021-07-21 v5

摘要

近年来,许多机器学习模型表现出基于种族、性别、年龄等对人歧视的事件被报道。已有研究致力于度量并缓解机器学习模型中的不公平性。对于机器学习任务,通常的做法是构建包含有序数据预处理阶段集合及其后分类器的流水线。然而,大多数公平性研究考虑的是基于单一分类器的预测任务。机器学习流水线中预处理阶段的公平性影响是什么?此外,研究表明不公平的根源往往植根于数据本身而非模型。但尚无研究度量由数据预处理阶段中特定变换所引起的不公平性。本文引入因果公平性方法来推理 ML 流水线中数据预处理阶段的公平性影响。我们利用已有度量定义各阶段的公平性测度。随后,我们对收集自三个不同来源的 37 条流水线中的预处理阶段进行了详细的公平性评估。我们的结果表明,某些数据转换器正导致模型表现出不公平性。我们在若干类数据转换器中识别出了若干公平性模式。最后,我们展示了预处理阶段的局部公平性如何组合为流水线的全局公平性。我们利用公平性组合来选择适当的下游转换器以缓解机器学习流水线中的不公平性。

关键词

引用

@article{arxiv.2106.06054,
  title  = {Fair Preprocessing: Towards Understanding Compositional Fairness of Data Transformers in Machine Learning Pipeline},
  author = {Sumon Biswas and Hridesh Rajan},
  journal= {arXiv preprint arXiv:2106.06054},
  year   = {2021}
}

备注

ESEC/FSE'2021: The 29th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering, Athens, Greece, August 23-28, 2021