用于荷兰医疗对话的高质量合成数据生成
计算与语言
2026-04-14 v1 人工智能
摘要
医疗对话提供了临床沟通中常缺失于电子健康记录(EHR)的见解。然而,开发可靠的临床自然语言处理(NLP)模型受限于领域特定数据集的稀缺,因为临床数据通常因隐私和伦理限制而不可获取。为解决这些挑战,我们提出了用于生成荷兰语医疗对话的管道,该管道使用针对荷兰语微调的人工智能大语言模型(LLM),以真实医疗对话作为语言和结构参考。生成的对话通过定量指标和来自母语者和医疗专业人员的定性审查进行评估。定量分析显示出强大的词汇多样性和过于规律的轮次安排,暗示对话流程呈现脚本化而非自然的特征。定性审查得分略低于平均水平,评审者指出领域特定性和自然表达方面存在问题。定量和定性结果之间的有限相关性表明,仅凭数值指标无法完全捕捉语言质量。我们的发现表明,生成荷兰语医疗对话是可行的,但需要领域知识和仔细构构化的提示才能在自然性和结构之间取得平衡。本工作为通过伦理上生成的合成数据扩展荷兰语临床 NLP 资源提供了基础。
引用
@article{arxiv.2604.09645,
title = {Generating High Quality Synthetic Data for Dutch Medical Conversations},
author = {Cecilia Kuan and Aditya Kamlesh Parikh and Henk van den Heuvel},
journal= {arXiv preprint arXiv:2604.09645},
year = {2026}
}
备注
Accepted to LREC 2026. This publication was supported by the MediSpeech project funded by ITEA4 under contract number 22032