中文

人工临床记录的零样本与少样本生成策略

计算与语言 2024-03-15 v2 机器学习

摘要

在遵守隐私法规的同时获取历史患者数据用于临床研究,是医学科学中的一个重大障碍。一种规避此问题的创新方法是利用能够反映真实患者数据而不损害个人隐私的合成医疗记录。创建这些合成数据集,尤其是在不使用真实患者数据训练大语言模型(LLM)的情况下,提出了一种新颖的解决方案,因为获取敏感的患者信息来训练模型本身也是一个挑战。本研究评估了 Llama 2 LLM 在零样本和少样本提示策略下创建能准确反映真实患者信息的合成医疗记录的能力,并与需要敏感患者数据进行训练的微调方法进行比较。我们专注于为“现病史”部分生成合成叙述,并利用 MIMIC-IV 数据集的数据进行对比。在这项工作中,我们引入了一种新颖的提示技术,该技术利用思维链方法,增强了模型在无需预先微调的情况下生成更准确且上下文相关的医学叙述的能力。我们的研究结果表明,基于 Rouge 指标评估,这种思维链提示方法使零样本模型能够取得与微调模型相当的结果。

关键词

引用

@article{arxiv.2403.08664,
  title  = {Zero-shot and Few-shot Generation Strategies for Artificial Clinical Records},
  author = {Erlend Frayling and Jake Lever and Graham McDonald},
  journal= {arXiv preprint arXiv:2403.08664},
  year   = {2024}
}

备注

4 pages