通过生成合成医疗时间序列实现细粒度亚组层面模型评估
机器学习
2025-10-23 v1 人工智能
摘要
我们提出了一种新框架,利用合成 ICU 时间序列数据不仅用于训练,还用于严格且可信地评估预测模型——既在总体水平,也在细粒度人口统计亚组内部。基于先前的扩散和 VAE 基方法 (TimeDiff、HealthGen、TimeAutoDiff),我们引入了 \textit{Enhanced TimeAutoDiff},该方法在潜在扩散目标中引入分布对齐惩罚。我们在 MIMIC-III 和 eICU 上对所有模型进行广泛基准测试,涵盖 24 小时死亡率和二元住院时长任务。我们的结果表明,Enhanced TimeAutoDiff 将真实-合成与真实-真实评估之间的差距(TRTS 间隙)缩小了 70%以上,实现 AUROC,同时保持训练实用性 ()。关键的是,对于 32 个交叉子组,大型合成队列在缩小亚组层面 AUROC 估计误差方面相较于小型真实测试集降低了最高可达 50%,并在 72--84% 的亚组中超越小型真实测试集。这一工作为在关键 care 环境中实现可靠、细粒度的模型评估提供了实用、隐私保护的道路,使在不暴露敏感临床电子健康记录数据的情况下,对医疗 AI 的可信度贡献了总体可靠性。
引用
@article{arxiv.2510.19728,
title = {Enabling Granular Subgroup Level Model Evaluations by Generating Synthetic Medical Time Series},
author = {Mahmoud Ibrahim and Bart Elen and Chang Sun and Gökhan Ertaylan and Michel Dumontier},
journal= {arXiv preprint arXiv:2510.19728},
year = {2025}
}