中文

经适配的大语言模型在临床文本摘要任务上可超越医学专家

计算与语言 2024-04-15 v5

摘要

分析海量文本数据并从电子健康记录中总结关键信息,给临床医生的时间分配带来了沉重负担。尽管大语言模型(LLMs)在自然语言处理(NLP)中已展现出潜力,但其在多样化临床摘要任务上的有效性仍未经证实。在本研究中,我们对八个LLM应用适配方法,涵盖四项不同的临床摘要任务:放射学报告、患者提问、病程记录以及医患对话。基于句法、语义和概念性NLP指标的定量评估揭示了模型与适配方法之间的权衡。一项由十位医师参与的临床读者研究评估了摘要的完整性、正确性与简洁性;在大多数情况下,我们最佳适配LLM生成的摘要与医学专家摘要相比要么相当(45%)要么更优(36%)。随后的安全性分析强调了LLM与医学专家共同面临的挑战,我们将错误与潜在医疗危害相关联,并对虚构信息的类型进行了分类。我们的研究提供了LLM在多项临床文本摘要任务中超越医学专家的证据。这表明将LLM整合进临床工作流可减轻文书负担,使临床医生能更专注于患者照护。

关键词

引用

@article{arxiv.2309.07430,
  title  = {Adapted Large Language Models Can Outperform Medical Experts in Clinical Text Summarization},
  author = {Dave Van Veen and Cara Van Uden and Louis Blankemeier and Jean-Benoit Delbrouck and Asad Aali and Christian Bluethgen and Anuj Pareek and Malgorzata Polacin and Eduardo Pontes Reis and Anna Seehofnerova and Nidhi Rohatgi and Poonam Hosamani and William Collins and Neera Ahuja and Curtis P. Langlotz and Jason Hom and Sergios Gatidis and John Pauly and Akshay S. Chaudhari},
  journal= {arXiv preprint arXiv:2309.07430},
  year   = {2024}
}

备注

27 pages, 19 figures