TarDiff:面向合成电子健康记录时间序列生成的目标导向扩散引导
机器学习
2025-04-25 v1
摘要
合成电子健康记录(EHR)时间序列生成对于推进临床机器学习模型至关重要,因为它通过提供更多训练数据来帮助解决数据稀缺问题。然而,大多数现有方法主要侧重于复制真实世界数据的统计分布和时间依赖性。我们认为,仅对观测数据的保真度并不能保证更好的模型性能,因为常见模式可能占据主导地位,限制了对罕见但重要病情的表示。这突出了生成合成样本以改善特定临床模型性能从而实现其目标结果的需求。为此,我们提出 TarDiff,一种新颖的目标导向扩散框架,将任务特定影响引导集成到合成数据生成过程中。与模仿训练数据分布的常规方法不同,TarDiff 通过影响函数量化合成样本对改善下游模型性能的预期贡献,从而优化合成样本。具体而言,我们测量合成样本引起的任务特定损失的减少,并将此影响梯度嵌入到反向扩散过程中,从而引导生成走向效用优化的数据。在六个公开可用的 EHR 数据集上的评估表明,TarDiff 实现了 SOTA 性能,在 AUPRC 和 AUROC 上分别比现有方法高出 20.4% 和 18.4%。我们的结果表明,TarDiff 不仅保持了时间保真度,还增强了下游模型性能,为医疗分析中的数据稀缺和类别不平衡提供了稳健的解决方案。
引用
@article{arxiv.2504.17613,
title = {TarDiff: Target-Oriented Diffusion Guidance for Synthetic Electronic Health Record Time Series Generation},
author = {Bowen Deng and Chang Xu and Hao Li and Yuhao Huang and Min Hou and Jiang Bian},
journal= {arXiv preprint arXiv:2504.17613},
year = {2025}
}