中文

分布迁移下的多来源保守推断

统计方法学 2024-05-16 v1 机器学习

摘要

近年来,复杂的机器学习模型正越来越多地用于多个数据源,以 Inform 更具可靠性的决策。然而,跨数据源的分布迁移、与共享 individual-level 数据相关的隐私 concerns,以及来自机器学习预测的缺乏不确定性量化,使得在多来源环境中实现有效推断具有挑战性。在本文中,我们考虑为目标 population 获取分布无偏预测区间的问题,利用多个可能偏斜的数据源。我们推导了目标和 source populations 中未观测结果分位数的 efficient influence functions,表明可以在估计 nuisance functions 时仍然将机器学习预测算法纳入其中,而仍能以参数收敛速率达到名义覆盖概率。此外,当条件 outcome invariance 被违反时,我们提出了一种数据自适应策略,用于提高信息丰富数据源的效率并降低非信息丰富数据源的偏差。我们通过大量合成实验突出了提议方法在各种保守得分和数据生成机制下的鲁棒性和效率。来自美国 2016-2022 年进行高风险心脏手术的儿童患者住院时间预测区间说明了该方法的实用性。

关键词

引用

@article{arxiv.2405.09331,
  title  = {Multi-Source Conformal Inference Under Distribution Shift},
  author = {Yi Liu and Alexander W. Levis and Sharon-Lise Normand and Larry Han},
  journal= {arXiv preprint arXiv:2405.09331},
  year   = {2024}
}

备注

Accepted to ICML 2024, 39 pages, 13 figures