中文

具有时间索引输入的生存模型中行政删失的陷阱

机器学习 2026-07-11 v1 应用统计

摘要

生存模型可以使用部分观测数据对事件发生时间结果进行建模。它们被广泛应用于临床预测,包括癌症风险、疾病进展、治疗反应和死亡率。最近的模型通常依赖于在特定临床就诊时收集的丰富输入,例如医学图像、实验室检查、电子健康记录快照或传感器测量。在大型回顾性数据集中,这些输入通常跨越多个日历年收集。因此,它们可能通过设备、协议、文档、患者组合或临床实践的变化包含关于其采集时间的线索。当结果仅观测至固定的研究结束日期时,这就产生了一种潜在的失效模式。较新的记录必然比较旧的记录具有更少的潜在随访时间。因此,能够从输入中推断出记录日期的模型可能会学习预测可用的随访时间,而不是患者经历该事件的真实风险。我们将这种失效模式称为行政截断泄漏。在本文中,我们表征了这种泄漏何时可能发生,将其与经典的信息删失和风险的真实时间变化区分开来,并提出了检测它的实用方法。在模拟中,我们表明行政截断泄漏会夸大固定时间窗的 AUC,并且在现实的随访模式下也会影响 Harrell 的 C 指数。然后,我们在真实的乳腺钼靶队列中证明了相同的行为。这些结果激发了一个简单的生存预测设计原则:对于 n 年预测任务,数据集应在最新输入日期之后提供至少 n 年的潜在随访时间。否则,模型可能会受到行政截断泄漏引起的偏差的影响。

关键词

引用

@article{arxiv.2607.10466,
  title  = {Pitfalls of Administrative Censoring in Survival Models with Time-Indexed Inputs},
  author = {Yanqi Xu and Hui Dai and Carlos Fernandez-Granda and Krzysztof J. Geras and Yiqiu Shen},
  journal= {arXiv preprint arXiv:2607.10466},
  year   = {2026}
}