中文

TrialSynth:用于合成顺序临床试验数据的生成方法

机器学习 2024-12-16 v2

摘要

分析过去临床试验的数据是优化新临床试验设计、实施与执行,以及更高效地将致命干预措施推向市场的 ongoing 努力的一部分。尽管近期在静态情境下合成临床试验数据的生成方面取得了进展,但由于患者可用性有限以及隐私需求的约束,针对细粒度顺序临床试验数据的生成仍具有挑战。鉴于患者在整个临床试验期间的轨迹对于优化试验设计和防止有害不良事件的努力至关重要,迫切需要生成高保真度的时间序列临床试验数据。本文引入了 TrialSynth,一种变分自编码器 (VAE),旨在解决生成顺序临床试验数据的特定挑战。与相关临床数据 VAE 方法不同,我们的方法核心采用 Hawkes 过程 (HP),该过程特别适合于捕捉顺序临床试验数据结构所需的事件类型与时间间隔预测。我们的实验表明,TrialSynth 在各种可比方法的性能上均遥遥领先,这些方法可在不同的保真度/隐私权衡水平上生成顺序临床试验数据,使我们能够跨多个真实世界顺序事件数据集生成高度准确的事件序列,尽管来源患者人数较少。值得注意的是,我们的实证发现表明,TrialSynth 不仅超越了现有临床序列生成方法,还能产生在实证上具有更好实用性的数据,同时经验证能有效保留患者隐私。

关键词

引用

@article{arxiv.2409.07089,
  title  = {TrialSynth: Generation of Synthetic Sequential Clinical Trial Data},
  author = {Chufan Gao and Mandis Beigi and Afrah Shafquat and Jacob Aptekar and Jimeng Sun},
  journal= {arXiv preprint arXiv:2409.07089},
  year   = {2024}
}