给我一些难题:临床问答的合成数据生成
计算与语言
2024-12-09 v1
摘要
临床问答(QA)系统使医生能够快速从电子健康记录(EHR)中访问患者信息。然而,训练这些系统需要大量标注数据,而由于所需的专业知识和与临床数据相关的隐私问题,这些数据是有限的。本文探讨了在零样本设置下使用大型语言模型(LLM)生成临床 QA 数据。我们发现,天真的提示往往产生简单的问题,不能反映临床场景的复杂性。为了解决这一问题,我们提出了两种提示策略:1)指示模型生成与输入上下文不重叠的问题;2)使用预定义模式总结输入记录以搭建问题生成框架。在两个临床 QA 数据集上的实验表明,我们的方法生成了更具挑战性的问题,显著提升了微调性能,优于基线方法。我们比较了合成数据和金标准数据,发现由于合成生成答案的质量差异,两者训练效果之间存在差距。
引用
@article{arxiv.2412.04573,
title = {Give me Some Hard Questions: Synthetic Data Generation for Clinical QA},
author = {Fan Bai and Keith Harrigian and Joel Stremmel and Hamid Hassanzadeh and Ardavan Saeedi and Mark Dredze},
journal= {arXiv preprint arXiv:2412.04573},
year = {2024}
}
备注
Accepted to ML4H 2024 Findings