中文

人工智能社区对合成医疗记录生成的现状探索案例研究

计算与语言 2025-04-28 v2 人工智能 机器学习

摘要

合成电子健康记录(EHR)为创建保留隐私且结构化统一的数据提供了宝贵的机会,支持医疗保健领域的众多应用。合成数据的关键优势包括对数据模式的精确控制、改善患者人群的公平性和代表性,以及无需担心泄露真实个体隐私即可共享数据集。因此,AI社区日益倾向于利用大型语言模型(LLM)在 various领域生成合成数据。然而,医疗领域的重大挑战在于确保合成健康记录能可靠地在不同医院之间推广,这是该领域长期存在的问题。本文评估了商业LLM生成合成数据的现状,并调查了生成过程的多个方面,以识别这些模型擅长的领域以及不足之处。我们的主要发现是,尽管LLM可以可靠地为较小特征子集生成合成健康记录,但随着数据维度的增加,这些模型在保持真实分布和相关性方面受限,最终限制了其在多样化医院环境中的推广能力。

关键词

引用

@article{arxiv.2504.14657,
  title  = {A Case Study Exploring the Current Landscape of Synthetic Medical Record Generation with Commercial LLMs},
  author = {Yihan Lin and Zhirong Bella Yu and Simon Lee},
  journal= {arXiv preprint arXiv:2504.14657},
  year   = {2025}
}

备注

Accepted at the Conference of Health, Inference, Learning (CHIL 2025) in Berkeley, CA. To appear in PMLR later in 2025