基于强化学习的数据获取用于改善模型公平性
机器学习
2024-12-05 v1 计算机与社会
摘要
机器学习系统正越来越多地被用于医疗、金融和刑事司法等关键决策中。围绕其公平性的关注导致了多种偏差缓解技术,强调需要高质量数据以确保更公平的决策。然而,机器学习管道的早期阶段在缓解模型偏差方面的作用尚未得到充分探索。本文聚焦于为训练下游机器学习模型获取额外标记数据点以快速提升其公平性的任务。由于数据池中并非所有数据点对公平性任务都同样有益,本文生成数据点应获取的排序。我们提出DataSift框架,基于数据定价思想,利用分区和多臂老虎机算法以确定最有价值的数据点。通过多个迭代,DataSift选择一个分区并随机抽取来自该分区的数据批次,评估获取该批次对模型公平性的影响,并根据影响程度更新分区的效用。在进一步提升批次评估效果与效率方面,我们利用影响函数在不重新训练模型的情况下估计获取数据批次的效果。我们在多个真实数据集和合成数据集上进行经验评估,表明即便获取少量数据点,机器学习模型的公平性也可显著提升。
引用
@article{arxiv.2412.03009,
title = {Data Acquisition for Improving Model Fairness using Reinforcement Learning},
author = {Jahid Hasan and Romila Pradhan},
journal= {arXiv preprint arXiv:2412.03009},
year = {2024}
}
备注
19 pages, 9 figures