预测 ML 软件配置的公平性
软件工程
2024-07-02 v2 人工智能
计算机与社会
机器学习
摘要
本文探讨了机器学习超参数与公平性之间的关系。数据驱动的解决方案日益增多地用于关键社会技术应用中,确保其公平性至关重要。与通过控制和数据结构显式编码决策逻辑不同,ML 开发人员提供输入数据、执行一些预处理、选择机器学习算法并调整超参数(HP),以推断编码决策逻辑的程序。先前的工作报告称,超参数的选择对公平性具有显著影响。然而,寻找准确率、精确率和公平性之间理想权衡的超参数调优仍然是昂贵且繁琐的任务。我们可以预测给定数据集的 HP 配置公平性吗?这些预测对分布迁移鲁棒吗?我们关注组公平概念,调查 5 种训练算法的 HP 空间。我们首先发现,树状回归器和 XGBoost 在准确预测 HP 配置公平性方面显著优于深度神经网络和支持向量机。在对 ML 超参数在时间分布迁移下进行公平性预测时,树状回归器以合理的准确率优于其他算法。然而,精确率取决于 ML 训练算法、数据集和受保护属性。例如,树状回归器模型在 logistic 回归和判别分析的 HPs 上针对性别作为受保护属性的训练数据从 2014 年迁移到 2018 年时表现稳健;但在种族和其他训练算法上则不稳健。我们的方法提供了一个高效执行 ML 训练算法微调并理解 HP 与公平性关系的可靠框架。
引用
@article{arxiv.2404.19100,
title = {Predicting Fairness of ML Software Configurations},
author = {Salvador Robles Herrera and Verya Monjezi and Vladik Kreinovich and Ashutosh Trivedi and Saeid Tizpaz-Niari},
journal= {arXiv preprint arXiv:2404.19100},
year = {2024}
}
备注
To Appear in the 20th International Conference on Predictive Models and Data Analytics in Software Engineering (PROMISE'24)