算法偏差与数据偏差:理解分布鲁棒优化与数据整理之间的关系
机器学习
2021-06-18 v1 机器学习
摘要
基于最小化平均误差的机器学习系统已被证明在数据的显著子集上表现不一致,而整个数据集的低平均误差并未暴露此问题。在代表人的重大社会与经济应用中,这可能导致对代表性不足的性别与族裔群体的歧视。鉴于偏差缓解在机器学习中的重要性,该主题引发了关于如何在实践中确保公平(数据偏差 versus 算法偏差)的争议性辩论。分布鲁棒优化(DRO)通过最小化子群体中最坏期望风险看似解决了此问题。我们建立了理论结果,阐明了DRO与在适当加权的训练数据集上平均相同损失的优化之间的关系。结果涵盖有限与无限个训练分布,以及凸与非凸损失函数。我们表明,DRO与整理训练集均不应被视作偏差缓解的完整解决方案:正如不存在普遍鲁棒的训练集,也不存在普遍的方式来建立DRO问题并确保社会可接受的结果集。我们随后利用这些见解,为使用DRO解决偏差提供了一组最小的实践建议。最后,我们以对抗鲁棒性为例讨论了我们的结果在DRO其他相关应用中的影响。我们的结果表明,只要支持这些立场的论点被精确限定并有当今相关数学支撑,偏差辩论中侧重算法与侧重数据的双方均有其价值。
引用
@article{arxiv.2106.09467,
title = {Algorithmic Bias and Data Bias: Understanding the Relation between Distributionally Robust Optimization and Data Curation},
author = {Agnieszka Słowik and Léon Bottou},
journal= {arXiv preprint arXiv:2106.09467},
year = {2021}
}