中文

机器学习分类器偏差缓解方法的综合性实证研究

软件工程 2023-02-13 v3 人工智能

摘要

软件偏差是软件工程师日益重要的运维关切。我们针对机器学习(ML)分类器的 17 种代表性偏差缓解方法,使用 11 种 ML 性能指标(如准确率)、4 种公平性指标和 20 类公平性-性能权衡评估,应用于 8 个广泛采用的软件决策任务,开展了一项大规模、综合性的实证研究。其实证覆盖远比以往关于这一重要软件属性的工作全面,涵盖了最大数量的偏差缓解方法、评估指标和公平性-性能权衡度量。我们发现:(1)在所研究场景中,偏差缓解方法使 ML 性能显著下降的情况占 53%(根据不同 ML 性能指标介于 42%~66%);(2)偏差缓解方法使所用 4 种指标度量的公平性显著改善的情况占全部场景的 46%(根据不同公平性指标介于 24%~59%);(3)偏差缓解方法甚至在 25% 的场景中导致公平性与 ML 性能同时下降;(4)偏差缓解方法的有效性取决于任务、模型、受保护属性的选择,以及用于评估公平性和 ML 性能的度量集合;(5)不存在能在所有场景中取得最佳权衡的偏差缓解方法。我们发现的最佳方法仅在 30% 的场景中优于其他方法。研究者和实践者需要选择最适合其预期应用场景的偏差缓解方法。

关键词

引用

@article{arxiv.2207.03277,
  title  = {A Comprehensive Empirical Study of Bias Mitigation Methods for Machine Learning Classifiers},
  author = {Zhenpeng Chen and Jie M. Zhang and Federica Sarro and Mark Harman},
  journal= {arXiv preprint arXiv:2207.03277},
  year   = {2023}
}

备注

Accepted by ACM Transactions on Software Engineering and Methodology (TOSEM 2023). Please include TOSEM in any citations