Leveraging Generative AI Through Prompt Engineering and Rigorous Validation to Create Comprehensive Synthetic Datasets for AI Training in Healthcare
人工智能
2025-04-30 v1
摘要
由于隐私 concerns,获取高质量医疗数据常受限制,这对在电子健康记录(EHR)应用中训练人工智能(AI)算法构成重大挑战。本研究采用 GPT-4 API 进行提示工程,生成高质量的合成数据集以克服这一限制。生成的数据涵盖患者入院信息的全面范围,包括医疗保健提供者信息、医院部门、病房、床位分配、患者人口统计学信息、紧急联系人、生命体征、免疫接种史、过敏史、病史、预约、住院记录、实验室检查、诊断、治疗计划、药物、临床笔记、访问日志、出院总结和转诊。为确保数据质量和完整性,我们采用了包括 BERT 的下一句预测用于句子连贯性、GPT-2 用于整体合理性、RoBERTa 用于逻辑一致性、自动编码器用于异常检测以及多样性分析等高级验证技术。符合所有验证标准的合成数据被整合到一个综合的 PostgreSQL 数据库中,用作EHR应用程序的数据管理系统。该方法表明,利用经过严格验证的生成式AI模型可以有效地生产高质量的合成医疗数据,促进AI算法的训练,同时解决了真实患者数据隐私问题。
引用
@article{arxiv.2504.20921,
title = {Leveraging Generative AI Through Prompt Engineering and Rigorous Validation to Create Comprehensive Synthetic Datasets for AI Training in Healthcare},
author = {Polycarp Nalela},
journal= {arXiv preprint arXiv:2504.20921},
year = {2025}
}