常见功能分解会误归因于人口差异的结果
统计方法学
2025-04-24 v1 机器学习
计量经济学
机器学习
摘要
在科学与社会科学中,我们常希望解释两个人口组之间的结果差异。例如,一个就业项目是否因一个城市的成员比另一个城市的成员受益更多,归因于项目参与者(特定协变量)还是当地劳动市场(给定协变量下的结果)?Kitagawa-Oaxaca-Blinder (KOB) 分解是计量经济学中的标准工具,用于解释两个人口组平均结果之间的差异。然而,KOB 分解假设协变量与结果之间存在线性关系,而实际关系可能具有意义的非线性。现代机器学习拥有多种用于解释单个人口组中结果与协变量之间关系的非线性函数分解方法。将 KOB 分解扩展使用这些函数分解似然是自然的。我们观察到,成功的扩展不应归因于协变量——或归因于给定协变量下的结果——如果这些在两个人口组中相同。不幸的是,我们演示了两种常见分解方法——函数 ANOVA 和 Accumulated Local Effects——即使在两个人口组中完全相同的给定协变量下的结果,也会归因于给定协变量下的结果。我们对函数 ANOVA 何时误归因的进行了表征,并提出了任何离散分解必须满足的一般属性,以避免误归因。我们进一步证明,如果分解独立于其输入分布,则不会误归因。我们进一步推测,误归因在任何合理的加法分解中都会发生,这些分解取决于协变量的分布。
引用
@article{arxiv.2504.16864,
title = {Common Functional Decompositions Can Mis-attribute Differences in Outcomes Between Populations},
author = {Manuel Quintero and William T. Stephenson and Advik Shreekumar and Tamara Broderick},
journal= {arXiv preprint arXiv:2504.16864},
year = {2025}
}
备注
30 pages, appearing in 2nd Workshop on Navigating and Addressing Data Problems for Foundation Models (DATA-FM @ ICLR 2025)