MIRIAD:Augmenting LLMs with millions of medical query-response pairs
计算与语言
2025-06-10 v2
摘要
大型语言模型(LLMs)有望通过高级决策支持和灵活的聊天助手机制造变革医疗保健领域。然而,LLMs 容易生成不准确的医学内容。为将 LLMs 锚定于高质量的医学知识,LLMs 已通过检索增强生成(RAG)等方式接入外部知识,后者将非结构化的医学知识分割成可选择检索并整合至 LLMs 上下文的小文本块。然而,现有 RAG 流程依赖原始非结构化医学文本,这类文本往往噪声大、缺乏规范,且难以被 LLMs 有效利用。目前缺乏系统的方法来组织医学知识,以便更好地向 LLMs 提供信息。为此,我们引入 MIRIAD,这是一个规模庞大且经过精心整理的医学问答语料库,包含 5,821,948 组医学问答对,每组问答均从同行评议的医学文献中经过 passage 提取,并经半自动化管道(结合 LLM 生成、筛选、锚定和人工标注)重述。与先前的医学语料库不同,MIRIAD 将海量医学知识转化为可操作化的查询-响应格式,从而实现更精准的检索。在具有挑战性的医学问答基准测试上进行实验表明,利用 MIRIAD 为 LLMs 提供增强可使准确率提升最高可达 6.7%,而这在使用相同来源语料库、相同数量检索文本的非结构化 RAG 基线方法上均未见。此外,MIRIAD 还能使 LLMs 检测医学幻觉的能力提升 22.5%至 37%(F1 分数提升)。我们进一步推出 MIRIAD-Atlas,这是一张覆盖 56 个医学学科的交互式地图,使临床用户能够直观地探索、检索和细化医学知识。MIRIAD 有望解锁诸多下游应用,包括医学信息检索器、增强型 RAG 应用以及知识锚定聊天界面,从而最终实现医疗领域 LLMs 应用的更高可靠性。
引用
@article{arxiv.2506.06091,
title = {MIRIAD: Augmenting LLMs with millions of medical query-response pairs},
author = {Qinyue Zheng and Salman Abdullah and Sam Rawal and Cyril Zakka and Sophie Ostmeier and Maximilian Purk and Eduardo Reis and Eric J. Topol and Jure Leskovec and Michael Moor},
journal= {arXiv preprint arXiv:2506.06091},
year = {2025}
}
备注
Preprint