重复损失最小化中无需人口统计信息的公平性
机器学习
2018-08-01 v2 机器学习
摘要
机器学习模型(例如语音识别器)通常被训练以最小化平均损失,这会导致表征差异——少数群体(例如非母语说话者)对训练目标的贡献较少,因此往往承受更高的损失。更糟的是,由于模型准确性影响用户留存,少数群体可能随时间萎缩。在本文中,我们首先表明经验风险最小化(ERM)的现状会随时间放大表征差异,这甚至能使初始公平的模型变得不公平。为缓解此问题,我们开发了一种基于分布鲁棒优化(DRO)的方法,该方法最小化所有接近经验分布的分布上的最坏情况风险。我们证明该方法在每个时间步控制少数群体的风险,符合罗尔斯分配正义的精神,同时不对群体身份有所察觉。我们展示了 DRO 在 ERM 失效的例子中阻止了差异放大,并显示了在真实世界文本自动补全任务中少数群体用户满意度的提升。
引用
@article{arxiv.1806.08010,
title = {Fairness Without Demographics in Repeated Loss Minimization},
author = {Tatsunori B. Hashimoto and Megha Srivastava and Hongseok Namkoong and Percy Liang},
journal= {arXiv preprint arXiv:1806.08010},
year = {2018}
}
备注
Final version for ICML2018, corrects typos