样本选择偏差下的公平回归
机器学习
2021-10-12 v1 人工智能
计算机与社会
摘要
近期关于公平回归的研究聚焦于发展新的公平性概念与近似方法,因为回归设定中目标变量甚至敏感属性都是连续的。然而,以往所有公平回归研究都假设训练数据与测试数据来自同一分布。由于训练与测试数据之间存在样本选择偏差,这一假设在现实世界中常被违背。本文针对样本选择偏差下的公平回归提出一个框架,此时训练数据中一组样本的依赖变量值因另一隐藏过程而缺失。我们的框架采用经典的 Heckman 模型进行偏差校正,并利用 Lagrange 对偶性基于多种公平性概念实现回归中的公平性。Heckman 模型描述样本选择过程,并使用一个名为逆米尔斯比(Inverse Mills Ratio, IMR)的派生变量来纠正样本选择偏差。我们利用公平性不等式与等式约束描述多种公平性概念,并应用 Lagrange 对偶理论将原问题转化为对偶凸优化。对于两种流行的公平性概念——均值差与均方误差差,我们推导出不依赖迭代优化的显式公式;对于 Pearson 相关,我们推导了其达到强对偶性的条件。我们在三个真实世界数据集上进行了实验,实验结果表明该方法在效用与公平性指标两方面均有效。
引用
@article{arxiv.2110.04372,
title = {Fair Regression under Sample Selection Bias},
author = {Wei Du and Xintao Wu and Hanghang Tong},
journal= {arXiv preprint arXiv:2110.04372},
year = {2021}
}