中文

用于校准增强生存分析的基于注意力的合成数据生成:基于电子健康记录的慢性肾病案例研究

机器学习 2025-03-11 v1

摘要

严格的隐私法规和数据不平衡限制了真实世界医疗数据的获取,阻碍了研究和临床应用的发展。合成数据提供了一种有前景的解决方案,但现有方法通常无法确保稳健的生存分析所必需的真实性、实用性和校准性。在此,我们引入了掩码临床建模(MCM),这是一种基于注意力的框架,能够生成高保真度的合成数据集,在增强生存模型校准的同时保留关键的临床见解(如风险比)。与SMOTE等传统统计方法和VAE等机器学习模型不同,MCM支持用于可重复性的独立数据集合成和用于定向增强的条件模拟,满足多样化的研究需求。在慢性肾病电子健康记录数据集上验证,MCM将整个数据集的总体校准损失降低了15%;并在10个临床分层子组中将平均校准损失降低了9%,优于15种替代方法。通过将数据可及性与转化实用性相结合,MCM提升了医疗模型的精度,促进了稀缺医疗资源的更高效利用。

关键词

引用

@article{arxiv.2503.06096,
  title  = {Attention-Based Synthetic Data Generation for Calibration-Enhanced Survival Analysis: A Case Study for Chronic Kidney Disease Using Electronic Health Records},
  author = {Nicholas I-Hsien Kuo and Blanca Gallego and Louisa Jorm},
  journal= {arXiv preprint arXiv:2503.06096},
  year   = {2025}
}