干净与清晰:安全 LLM 临床指导的可行性研究
计算与语言
2025-05-07 v2
摘要
背景:临床指南是现代医疗保健中安全基于证据的医学的核心,为各种疾病提供诊断标准、治疗选项和监测建议。LLM 赋能的聊天机器人在医学问答任务中显示出巨大的潜力,提供快速准确的医学咨询响应。我们的主要目标是开发和初步评估一个 LLM 赋能的聊天机器人软件,能够可靠地使用 University College London Hospital(UCLH)临床指南回答临床指南问题。方法:我们使用开源 Llama-3.1-8B LLM 从 UCLH 指南中提取相关信息以回答问题。我们的做法强调引用信息的安全性和可靠性,而非其解释和响应生成。来自急诊科的七位医生评估了聊天机器人的性能,通过将其答案与黄金标准进行比较。结果:我们的聊天机器人在相关性方面表现出色,约有 73% 的响应被评为非常相关,显示出对临床背景的强烈理解。重要的是,我们的聊天机器人在提取指南行语句方面实现了 1.00 的召回率,显著降低了遗漏关键信息的风险。约有 78% 的响应在完整性方面被评为令人满意。少部分(约 14.5%)包含不必要的细节,表明偶有精确度方面的小瑕疵。聊天机器人显示出高效性,平均完成时间为 10 秒,远快于人类答复者的 30 秒。临床推理评估显示,72% 的聊天机器人响应无任何缺陷。我们的聊天机器人展现出显著的潜力,以加速和提高医疗专业人员获取当地相关临床信息的过程。
引用
@article{arxiv.2503.20953,
title = {Clean & Clear: Feasibility of Safe LLM Clinical Guidance},
author = {Julia Ive and Felix Jozsa and Nick Jackson and Paulina Bondaronek and Ciaran Scott Hill and Richard Dobson},
journal= {arXiv preprint arXiv:2503.20953},
year = {2025}
}