偏置放大的系统性研究
机器学习
2022-10-20 v2 计算机视觉与模式识别
摘要
近期研究表明,机器学习模型的预测会放大训练数据中存在的偏置。当模型放大偏置时,其对某些群体的特定预测率高于基于训练数据统计所预期的水平。缓解此类偏置放大需深入理解现代机器学习中引发该放大的机制。我们开展了首个关于偏置放大何时及如何发生的系统性受控研究。为支撑此研究,我们设计了一个可紧密控制(合成)偏置的简单图像分类问题。对该问题的研究表明,偏置放大的强度与模型准确率、模型容量、模型过度自信及训练数据量等度量相关。我们还发现偏置放大在训练过程中可能大幅波动。最后,我们发现偏置放大可能取决于分类任务难度相对于识别群体归属难度的关系:偏置放大似乎主要发生在识别群体归属比识别类别归属更容易时。我们的结果提出了训练机器学习模型的最佳实践,有望为开发更好的缓解策略铺平道路。代码见 https://github.com/facebookresearch/cv_bias_amplification。
引用
@article{arxiv.2201.11706,
title = {A Systematic Study of Bias Amplification},
author = {Melissa Hall and Laurens van der Maaten and Laura Gustafson and Maxwell Jones and Aaron Adcock},
journal= {arXiv preprint arXiv:2201.11706},
year = {2022}
}