机器学习库的公平性感知配置
软件工程
2022-02-15 v1 计算机与社会
机器学习
摘要
本文研究机器学习(ML)算法的参数空间在加剧或缓解公平性缺陷中的作用。数据驱动的软件正日益应用于社会关键(social-critical)应用中,确保公平性至关重要。现有方法侧重于通过修改输入数据集或修改学习算法来解决公平性缺陷。另一方面,提供对 ML 算法更精细控制的超参数的选择,可能提供一种侵入性更小的方式来影响公平性。超参数会放大还是抑制输入数据集中存在的歧视?我们如何帮助程序员检测、理解并利用超参数的作用来改善公平性?我们设计了三种基于搜索的软件测试算法,以揭示超参数空间的精度-公平性边界。我们以统计调试补充这些算法,以解释这些参数在改善公平性中的作用。我们在工具 Parfait-ML(PARameter FAIrness Testing for ML Libraries,机器学习库参数公平性测试)中实现了所提方法,并展示了其在六个社会关键应用中使用的五种成熟 ML 算法上的有效性与实用性。在这些应用中,我们的方法成功识别出在不牺牲精度的前提下显著改善公平性(相较于最先进技术)的超参数。令人惊讶的是,对于某些算法(例如随机森林),我们的方法表明某些超参数配置(例如限制属性的搜索空间)会在不同应用中放大偏差。经进一步调查,我们找到了这些现象的直观解释,且结果与文献中的类似观察相印证。
引用
@article{arxiv.2202.06196,
title = {Fairness-aware Configuration of Machine Learning Libraries},
author = {Saeid Tizpaz-Niari and Ashish Kumar and Gang Tan and Ashutosh Trivedi},
journal= {arXiv preprint arXiv:2202.06196},
year = {2022}
}
备注
12 Pages, To Appear in 44th International Conference on Software Engineering (ICSE 2022)