中文

诱发偏见的几何结构:一个具有公平性启示的可精确求解数据模型

机器学习 2024-12-02 v4 无序系统与神经网络 机器学习

摘要

机器学习(ML)可能对人类偏见视而不见,但并不能免于对其的延续。边缘化与不公平的群体表征往往可在用于训练的数据中追溯,并可能被学习模型反映甚至放大。在本文中,我们旨在阐明数据几何结构在机器学习偏见涌现中所起的作用。我们引入了一个可精确求解的高维数据不平衡模型,其中对诸多诱发偏见因素的参数化控制使得我们能够广泛探索偏见继承机制。借助统计物理工具,我们解析刻画了在该合成框架下训练所得学习模型的典型性质,并获得了常用于公平性评估的观测量的精确预测。尽管数据模型简单,我们仍重现并剖析了在真实世界数据集上观察到的典型不公平行为。我们还获得了一类偏见缓解策略的详细解析刻画。我们首先考虑一种基本的损失重加权方案,其可实现对不同不公平度量的隐式最小化,并量化了若干现有公平性准则之间的不相容性。随后,我们考虑一种基于匹配推断方法的新颖缓解策略,即引入耦合学习模型。我们对该方法的理论分析表明,耦合策略能够取得更优的公平性-准确率权衡。

关键词

引用

@article{arxiv.2205.15935,
  title  = {Bias-inducing geometries: an exactly solvable data model with fairness implications},
  author = {Stefano Sarao Mannelli and Federica Gerace and Negar Rostamzadeh and Luca Saglietti},
  journal= {arXiv preprint arXiv:2205.15935},
  year   = {2024}
}

备注

10 pages + appendix