简单性偏置导致被放大的性能差异
机器学习
2023-06-09 v2 计算机与社会
摘要
给定模型会认为数据集的哪些部分难以学习?近期工作表明,经 SGD 训练的模型具有朝向简单性的偏置,导致它们优先学习多数类,或依赖于有害的伪相关。此处我们表明,对“容易”样本的偏好更为深远:模型可能优先处理其认为简单的任何类别或数据组——而以牺牲其认为复杂的部分为代价——这由测试集上的性能差异衡量。当具有不同复杂度水平的子集与人口统计群体对齐时,我们称之为难度差异,这是一种即便在缺乏群体/标签关联的平衡数据集中也会发生的现象。我们展示了难度差异如何是一种依赖于模型的量,并且会在通过典型平均性能分数所选用的常用模型中进一步被放大。我们量化了一系列设定下的放大因子,以比较固定数据集上不同模型的差异程度。最后,我们给出了两个难度放大作用的真实示例,即便使用平衡数据集,群体间的性能差异仍比预期更糟。此类差异在平衡数据集中的存在表明,仅平衡各群体的样本量不足以确保无偏性能。我们希望本工作是迈向可度量地理解模型偏置与其同数据结构相互作用的一步,并呼吁在数据集审计之外部署额外的依赖于模型的缓解方法。
引用
@article{arxiv.2212.06641,
title = {Simplicity Bias Leads to Amplified Performance Disparities},
author = {Samuel J. Bell and Levent Sagun},
journal= {arXiv preprint arXiv:2212.06641},
year = {2023}
}
备注
In 2023 ACM Conference on Fairness, Accountability, and Transparency (FAccT '23). ACM