面向查询英国 NICE 临床指南的大语言模型临床证据 grounding 系统
计算与语言
2025-12-16 v3 人工智能
信息检索
摘要
本文提出了一种检索增强生成(RAG)系统,用于查询英国国家健康护理专家委员会(NICE)临床指南。大量临床指南的篇幅和数量往往会阻碍其在时间受限的医疗系统中的应用。本项目通过创建能够针对自然语言查询提供精确匹配信息的系统来解决此问题。该系统的检索架构由混合嵌入机制组成,针对由三百篇指南派生的 10,195 条文本块进行评估。其在 7901 个查询上的表现显示,Mean Reciprocal Rank(MRR)为 0.814,前一个块的 Recall 为 81%,前十个检索块的 Recall 为 99.1%。最重要的影响在生成阶段得到体现。在针对七十个问答对的手动挑选数据集上评估时,RAG 增强模型的性能显著提升。忠实度——即答案是否得到来源文本的支持——对于使用 RAG 增强的 O4-Mini 模型提升了 64.7 个百分点至 99.5%,显著优于医疗领域的 Meditron3-8B LLM(得分 43%)。由七位主管医学专家(SME)进行的临床评估进一步验证了这些发现,GPT-4.1 在准确率达到 98.7% 的同时,将不安全响应数从 3.0 降至 1.0(较 O4-Mini 降低 67%)。因此,本研究表明 RAG 是一种有效、可靠且可扩展的医疗保健领域应用生成式 AI 的方法,为医疗指南提供了成本有效的访问途径。
引用
@article{arxiv.2510.02967,
title = {Grounding Large Language Models in Clinical Evidence: A Retrieval-Augmented Generation System for Querying UK NICE Clinical Guidelines},
author = {Matthew Lewis and Samuel Thio and Amy Roberts and Catherine Siju and Whoasif Mukit and Rebecca Kuruvilla and Zhangshu Joshua Jiang and Niko Möller-Grell and Aditya Borakati and Richard JB Dobson and Spiros Denaxas},
journal= {arXiv preprint arXiv:2510.02967},
year = {2025}
}