中文

生成可靠的合成临床试验数据:超参数优化与领域约束的作用

机器学习 2025-12-16 v2 人工智能

摘要

合成临床试验数据的生成提供了一种缓解医学研究中隐私关注和数据可访问性限制的有前景的方法。然而,确保合成数据集在保真性、实用性以及遵循领域特定约束方面保持高质量仍是关键挑战。虽然超参数优化(HPO)可提高生成模型性能,但不同优化策略对于合成临床数据有效性尚不明确。本研究系统评估了四种HPO目标跨九个生成模型,比较了单指标与复合指标优化。我们的结果表明,HPO始终改善合成数据质量,Tab DDPM实现了最大的相对提升,其后为TVAE(提升60%)、CTGAN(提升39%)和CTAB-GAN+(提升38%)。复合指标优化优于单指标目标,产生更具可迁移性的合成数据集。尽管提高了整体质量,HPOalone无法防止关键临床生存约束的违反。预处理和后处理在减少这些违反方面发挥了关键作用,缺乏健壮处理步骤的模型在最坏情况下会产生无效数据的比例最高达61%。这些发现凸显了在生成高质量合成数据集时,必须将显式领域知识与HPO相结合的必要性。我们的研究提供了改进合成数据生成的可操作性建议,未来工作需要在更大数据集上细化指标选择并验证研究结果。

关键词

引用

@article{arxiv.2505.05019,
  title  = {Generating Reliable Synthetic Clinical Trial Data: The Role of Hyperparameter Optimization and Domain Constraints},
  author = {Waldemar Hahn and Jan-Niklas Eckardt and Christoph Röllig and Martin Sedlmayr and Jan Moritz Middeke and Markus Wolfien},
  journal= {arXiv preprint arXiv:2505.05019},
  year   = {2025}
}

备注

Published in Information Sciences, Volume 733 (2026)