联邦时间线合成:面向模型训练与部署的可扩展隐私保护方法
机器学习
2025-07-01 v1 人工智能
摘要
我们提出了 Federated Timeline Synthesis(FTS),这是一种用于电子健康记录(EHR)中分布式时间序列数据的生成式基础模型训练的新框架。FTS 的核心是将患者历史表示为标记化的患者健康时间线(PHT),这些是编码包含时间、类别和连续临床信息的语言无关序列。每所机构在本地 PHT 上训练一个自回归变换器,并仅传输模型权重至中央服务器。服务器利用生成器合成大量轨迹并训练全局生成器(GG),通过蒙特卡洛模拟未来 PHT 实现零样本推断。我们在使用 MIMIC-IV 数据对五个临床意义预测任务进行评估,结果表明在合成数据上训练的模型性能与在真实数据上训练的模型相当。FTS 提供了强大的隐私保障,跨机构可扩展,能够适用于各种预测和仿真任务,尤其是在医疗保健领域,包括反事实推断、早期预警检测和合成试验设计。
引用
@article{arxiv.2506.23358,
title = {Federated Timeline Synthesis: Scalable and Private Methodology For Model Training and Deployment},
author = {Pawel Renc and Michal K. Grzeszczyk and Linglong Qian and Nassim Oufattole and Jeff Rasley and Arkadiusz Sitek},
journal= {arXiv preprint arXiv:2506.23358},
year = {2025}
}
备注
conference paper