数据与模型机器学习公平性测试:一项实证研究
机器学习
2024-01-17 v1 计算机与社会
软件工程
摘要
尽管文献中存在多种公平性定义与偏差缓解技术,但所有现有方案均在训练阶段之后评估机器学习(ML)系统的公平性。本文首次尝试评估一种更全面的方法,即在模型训练前后均进行公平性测试。我们通过对模型依赖与模型无关公平性指标之间关系的实证分析,评估了所提方法的有效性,并将其置于ML开发生命周期中。该研究使用了2个公平性指标、4种ML算法、5个真实世界数据集和1600次公平性评估循环。我们发现,当训练数据的分布和规模发生变化时,数据公平性指标与模型公平性指标之间存在线性关系。结果表明,在训练前进行公平性测试可以作为一种“低成本”且有效的手段,用于及早发现存在偏差的数据收集过程、检测生产系统中的数据漂移,并最大限度地减少完整训练周期的执行,从而降低开发时间和成本。
引用
@article{arxiv.2401.07697,
title = {Data vs. Model Machine Learning Fairness Testing: An Empirical Study},
author = {Arumoy Shome and Luis Cruz and Arie van Deursen},
journal= {arXiv preprint arXiv:2401.07697},
year = {2024}
}