中文

缓解差异影响估计中的包含变量偏倚与遗漏变量偏倚

应用统计 2024-01-29 v4

摘要

管理者、雇主、政策制定者及其他人员常常试图理解决策是否对某些群体存在偏倚。一种流行的分析策略是在调整观测协变量后估计差异,通常使用回归模型。然而,该方法面临两个关键的统计挑战。首先,若模型未调整所有相关因素,遗漏变量偏倚会使结果偏斜;其次,反之,包含变量偏倚——一个较少为人所知的现象——若协变量集合包含了无关因素,也会使结果偏斜。在此,我们引入一种新颖的三步统计方法,称之为风险调整回归,以在决策者具有明确可度量目标的场景下解决上述两方面问题。第一步,我们利用所有可用协变量估计采取某项行动(如批准贷款申请或雇佣求职者)的价值或反之的风险。第二步,我们仅依据这些风险估计来调整决策差异,从而缓解包含变量偏倚问题。最后,在第三步,我们评估结果对风险潜在误测的敏感性,以解决对遗漏变量偏倚的担忧。为此,我们开发了一种新颖的非参数敏感性分析,可依据真实风险与估计风险之间的平均差距——一个可解释的单参数——给出真实差异的紧界,从而促成可信的估计。我们在包含纽约市 220 万次行人警察拦截的详细数据集上演示了该方法,并表明传统的歧视统计检验会大幅低估差异的程度。

关键词

引用

@article{arxiv.1809.05651,
  title  = {Mitigating Included- and Omitted-Variable Bias in Estimates of Disparate Impact},
  author = {Jongbin Jung and Sam Corbett-Davies and Johann D. Gaebler and Ravi Shroff and Sharad Goel},
  journal= {arXiv preprint arXiv:1809.05651},
  year   = {2024}
}