中文

在协变量偏移下结合自动化计算表型的高效推断

统计方法学 2025-05-29 v1

摘要

通过人工提取收集金标准表型数据通常耗时费力且速度缓慢,而自动化计算表型提供了一种系统且更快的替代方案。然而,如果不承认两者之间的差异,简单地用 ACP 替代金标准,可能会导致有偏的结果和误导性的结论。受在保持下游分析有效性的同时结合 ACP 的复杂性所启发,本文考虑了一种半监督学习设定,在协变量偏移框架下,包含带标签数据(具有金标准)和未标记数据(无金标准)。我们开发了双重稳健且半参数有效的估计量,在未标记数据和组合总体中利用 ACP 估计一般目标参数。此外,我们仔细分析了结合 ACP 所带来的效率提升,比较了包含和不包含 ACP 的场景。值得注意的是,我们发现未标记数据的 ACP,而非标记数据的 ACP,驱动了效率的显著提升。为了验证我们的理论发现,我们进行了全面的合成实验,并将该方法应用于多个真实世界数据集,证实了我们方法的实际优势。代码:https://github.com/brucejunjin/ICML2025-ACPCS

关键词

引用

@article{arxiv.2505.22632,
  title  = {Towards the Efficient Inference by Incorporating Automated Computational Phenotypes under Covariate Shift},
  author = {Chao Ying and Jun Jin and Yi Guo and Xiudi Li and Muxuan Liang and Jiwei Zhao},
  journal= {arXiv preprint arXiv:2505.22632},
  year   = {2025}
}