基于 LLM 的文本到表格方法用于生成合成患者数据
机器学习
2025-06-25 v2
摘要
获取大规模高质量医疗数据库是加速医学研究并洞察疾病特性的关键,但患者隐私、数据共享限制及高昂成本常使其获取受限。为克服此困境,合成患者数据作为一种替代方案日益受到关注。然是,合成数据生成(SDG)方法通常依赖于在原始数据上训练的机器学习模型,重新触发数据稀缺问题。我们提出一种无需访问原始数据,仅需数据库描述即可生成合成表格患者数据的做法。我们利用先验医学知识及大语言模型(LLM)的原语学习能力,生成即使在资源有限的情境下也能实现逼真的患者数据。我们对方法进行了基于保真度、隐私性与实用性指标的量化评估。结果表明,尽管 LLM 在匹配在原始数据上训练的先进模型性能方面存在不足,但它们能有效生成保持临床相关性良好的逼真患者数据。消融研究揭示了促成高质量合成患者数据生成的关键提示元素。该方法使用便捷,无需原始数据或高级机器学习技能,特别适用于快速生成定制化患者数据,支持项目实施并提供教育资源。
引用
@article{arxiv.2412.05153,
title = {A text-to-tabular approach to generate synthetic patient data using LLMs},
author = {Margaux Tornqvist and Jean-Daniel Zucker and Tristan Fauvel and Nicolas Lambert and Mathilde Berthelot and Antoine Movschin},
journal= {arXiv preprint arXiv:2412.05153},
year = {2025}
}
备注
12 pages, 3 figures. Accepted to the 2025 IEEE International Conference on Healthcare Informatics (IEEE ICHI 2025), 2025, Rende (CS), Calabria, Italy