中文

超越再加权:关于协变量漂移在效应泛化中的预测作用

应用统计 2024-12-13 v1 机器学习 统计方法学

摘要

许多现有的分布漂移下统计推断方法都基于协变量漂移假设,即未观测变量在给定观测变量条件下的分布在不同人群之间保持不变。然而,最近的实证研究表明,仅通过调整观测变量(协变量漂移)的漂移,往往不足以实现泛化。换言之,协变量漂移通常不会“解释掉”不同情境之间的分布漂移。因此,针对未观测变量在给定观测变量条件下的未知但不容忽视的漂移(条件漂移)进行处理,对泛化推断至关重要。本文我们 presenting 一系列来自两个大型多站点复制研究的实证证据,以支持协变量漂移在“预测”未知条件漂移强度的新角色。分析了 680 项研究涵盖 65 个站点,我们发现尽管条件漂移虽然不可忽视,但其强度往往可以由可观测协变量漂移的强度所界定。然而,这一模式只有当两种漂移来源量化为我们提出的标准化的“关键”措施时才会出现。我们通过将其与从随机分布漂移模型中可以理论推导出的类似模式相联系来解释这一现象。最后,我们演示了利用协变量漂移的预测作用,能够在数据部分观测的泛化任务中实现可靠且高效的目标估计不确定性量化。总体而言,我们的实证与理论分析表明,这是一种全新方法来处理分布漂移、泛化性和外部有效性的问题。

关键词

引用

@article{arxiv.2412.08869,
  title  = {Beyond Reweighting: On the Predictive Role of Covariate Shift in Effect Generalization},
  author = {Ying Jin and Naoki Egami and Dominik Rothenhäusler},
  journal= {arXiv preprint arXiv:2412.08869},
  year   = {2024}
}