中文

干预情境下的模型性能度量

机器学习 2025-11-18 v2 人工智能

摘要

AI 模型通常根据其预测感兴趣结果的能力进行评估。然而,在许多面向社会影响的 AI 应用中,存在干预会影响结果,从而可能偏置评估。随机对照试验(RCT)通过随机分配干预,允许利用来自对照组的数据进行无偏模型评估。然而,这种方法效率低下,因为它忽略了来自处理组的数据。鉴于 RCT 往往涉及的复杂性和成本,充分利用数据至关重要。因此,我们调查了能利用 RCT 中全部数据进行模型评估的策略。首先,我们理论量化了从处理组和对照组的性能估计简单聚合中产生的估计偏差,并推导出该偏差导致错误模型选择的条件。凭借这些理论见解,我们提出了 nuisance 参数加权(NPW)方法,对处理组的数据进行重新加权,以模拟在无干预或有干预情况下样本的分布。使用合成数据和真实数据集,我们展示了我们提出的评估方法在各种干预效应和样本规模设置下, consistently 优于忽略处理组数据的标准方法,实现更好的模型选择。我们的贡献代表了向更高效的现实世界情境模型评估迈出的重要一步。

关键词

引用

@article{arxiv.2511.05805,
  title  = {Measuring Model Performance in the Presence of an Intervention},
  author = {Winston Chen and Michael W. Sjoding and Jenna Wiens},
  journal= {arXiv preprint arXiv:2511.05805},
  year   = {2025}
}

备注

AAAI 2026