中文

在存在真实修改的情况下估计误报:因果视角

机器学习 2025-06-02 v1

摘要

在利用机器学习模型为资源分配提供依据的场景中,受分配决策影响的代理可能有动机通过策略性地改变其特征来确保获得更好的结果。尽管先前的工作已对策略性响应进行了广泛研究,但将误报与真实修改区分开来仍是一个基本挑战。在本文中,我们提出了一种基于因果动机的方法,通过区分特征中的欺骗性改变与真实修改,来识别和量化代理的平均误报程度。我们的核心洞察是,与真实修改不同,误报的特征不会对下游变量(即因果后代)产生因果影响。我们利用这种不对称性,将通过处理数据集得出的误报特征对其因果后代的因果效应与未处理数据集得出的结果进行比较。我们形式化地证明了误报率的可识别性,并刻画了我们估计量的方差。我们使用半合成和真实的 Medicare 误报数据集对我们的理论结果进行了实证验证,表明我们的方法可用于识别现实场景中的误报行为。

关键词

引用

@article{arxiv.2505.23954,
  title  = {Estimating Misreporting in the Presence of Genuine Modification: A Causal Perspective},
  author = {Dylan Zapzalka and Trenton Chang and Lindsay Warrenburg and Sae-Hwan Park and Daniel K. Shenfeld and Ravi B. Parikh and Jenna Wiens and Maggie Makar},
  journal= {arXiv preprint arXiv:2505.23954},
  year   = {2025}
}