一种以数据为中心的方法:利用大语言模型生成忠实且高质量的患者摘要
计算与语言
2024-06-26 v2 人工智能
机器学习
摘要
患者往往难以理解其住院情况,而医护人员资源有限,难以提供充分解释。在本研究中,我们探讨了大语言模型基于医生笔记生成患者摘要的潜力,并研究了训练数据对生成摘要的忠实度和质量的影响。为此,我们发布了:(i) 一套针对医学文本错误的严格标注协议;(ii) 一个公开数据集,包含对 100 篇医生撰写摘要和 100 篇生成摘要中幻觉现象的标注。我们表明,在无幻觉数据上进行微调可有效将 Llama 2 的每篇摘要幻觉数从 2.60 降至 1.55,同时保留相关信息。当少样本示例无幻觉时,我们在 GPT-4 上也观察到类似效果(从 0.70 降至 0.40)。我们还利用无幻觉及改进后的训练数据进行了定性评估,发现常见的定量指标与忠实度和质量的相关性不佳。最后,我们测试了 GPT-4 用于自动幻觉检测的能力,其表现明显优于常见基线方法。
引用
@article{arxiv.2402.15422,
title = {A Data-Centric Approach To Generate Faithful and High Quality Patient Summaries with Large Language Models},
author = {Stefan Hegselmann and Shannon Zejiang Shen and Florian Gierse and Monica Agrawal and David Sontag and Xiaoyi Jiang},
journal= {arXiv preprint arXiv:2402.15422},
year = {2024}
}