基于大语言模型系统回答实际临床问题
计算与语言
2024-07-02 v1 人工智能
信息检索
摘要
用于指导医疗决策的证据常常受限于缺乏相关且可信的文献,以及难以将现有研究置于特定患者的背景下。大语言模型(LLMs)可能通过要么总结已发布的文献,要么基于真实世界数据(RWD)生成新研究来解决这两个挑战。我们评估了五个基于大语言模型的系统在回答 50 个临床问题时的能力,并请九位独立的医生审阅这些回答的相关性、可靠性和可操作性。就目前而言,通用型大语言模型(如 ChatGPT-4、Claude 3 Opus、Gemini Pro 1.5)很少产生被认为是相关且基于证据的答案(2% - 10%)。相比之下,基于检索增强生成(RAG)的和基于智能体(agentic)的 LLM 系统在 24%(OpenEvidence)至 58%(ChatRWD)的问题中产生了相关且基于证据的答案。只有 agentic ChatRWD 能够回答其他 LLM 无法回答的新问题(65% 对 0-9%)。这些结果表明,尽管通用型大语言模型不应原样使用,但一个基于 RAG 的证据总结系统和一个用于生成新证据的系统可以协同工作,从而提高患者护理中相关证据的可用性。
引用
@article{arxiv.2407.00541,
title = {Answering real-world clinical questions using large language model based systems},
author = {Yen Sia Low and Michael L. Jackson and Rebecca J. Hyde and Robert E. Brown and Neil M. Sanghavi and Julian D. Baldwin and C. William Pike and Jananee Muralidharan and Gavin Hui and Natasha Alexander and Hadeel Hassan and Rahul V. Nene and Morgan Pike and Courtney J. Pokrzywa and Shivam Vedak and Adam Paul Yan and Dong-han Yao and Amy R. Zipursky and Christina Dinh and Philip Ballentine and Dan C. Derieg and Vladimir Polony and Rehan N. Chawdry and Jordan Davies and Brigham B. Hyde and Nigam H. Shah and Saurabh Gombar},
journal= {arXiv preprint arXiv:2407.00541},
year = {2024}
}
备注
28 pages (2 figures, 3 tables) inclusive of 8 pages of supplemental materials (4 supplemental figures and 4 supplemental tables)