公平性反馈循环:在合成数据上训练会放大偏差
机器学习
2024-03-13 v1
摘要
模型诱导的分布偏移 (MIDS) 是指随着模型的迭代,先前模型的输出污染了新模型的训练集。这种现象在生成模型中被称为模型崩溃,在监督模型中被称为执行预测或不公平反馈循环。当模型引发分布偏移时,它也会将其错误、偏差和不公平性编码到其数据生态系统的真实标签中。我们引入了一个框架,使我们能够跟踪多代模型中的多个 MIDS,发现即使最初的数据集是无偏的,它们也可能导致性能、公平性和少数群体代表性的下降。尽管存在这些负面后果,我们还是确定了如何利用模型在其数据生态系统中进行积极的、有意的干预,通过一个称为算法补偿 (AR) 的框架为历史歧视提供补救。我们通过为随机梯度下降策划具有代表性的训练批次来模拟 AR 干预,以展示 AR 如何能够改善受其他 MIDS 影响的模型和数据生态系统的不公平性。我们的工作在识别、缓解和追究由“机器学习系统本质上是中立和客观的”这一理念所导致的不公平反馈循环方面迈出了重要的一步。
引用
@article{arxiv.2403.07857,
title = {Fairness Feedback Loops: Training on Synthetic Data Amplifies Bias},
author = {Sierra Wyllie and Ilia Shumailov and Nicolas Papernot},
journal= {arXiv preprint arXiv:2403.07857},
year = {2024}
}