中文

SynLLM:通过提示工程对用于医学表格合成数据生成的大型语言模型的比较分析

人工智能 2025-08-13 v1

摘要

由于隐私法规的限制,对真实世界医学数据的访问常常受到限制,这对医疗保健研究的进步构成了重大障碍。合成数据提供了一种有前景的替代方案;然而,生成真实、临床有效且注重隐私的记录仍然是一项重大挑战。大型语言模型(LLMs)的最新进展为结构化数据生成提供了新的机遇;然而,现有方法往往缺乏系统性的提示策略和全面的多维度评估框架。在本文中,我们提出了 SynLLM,这是一个模块化框架,用于在结构化提示的指导下,利用包括 LLaMA、Mistral 和 GPT 变体在内的 20 个最先进的开源 LLM 生成高质量的合成医学表格数据。我们提出了四种不同的提示类型,从示例驱动到基于规则的约束,这些提示编码了模式、元数据和领域知识,以在不进行模型微调的情况下控制生成。我们的框架具有一个全面的评估流程,从统计保真度、临床一致性和隐私保护等方面严格评估生成的数据。我们使用 20 个开源 LLM,在包括糖尿病、肝硬化和中风在内的三个公共医学数据集上评估了 SynLLM。我们的结果表明,提示工程显著影响数据质量和隐私风险,其中基于规则的提示实现了最佳的隐私-质量平衡。SynLLM 证实,当以精心设计的提示为指导,并以稳健的多指标标准进行评估时,LLM 能够生成既在临床上合理又具有隐私意识的合成医学数据,为医疗保健研究中更安全、更有效的数据共享铺平了道路。

关键词

引用

@article{arxiv.2508.08529,
  title  = {SynLLM: A Comparative Analysis of Large Language Models for Medical Tabular Synthetic Data Generation via Prompt Engineering},
  author = {Arshia Ilaty and Hossein Shirazi and Hajar Homayouni},
  journal= {arXiv preprint arXiv:2508.08529},
  year   = {2025}
}

备注

10 Pages, 2 Supplementary Pages, 6 Tables