通过检索增强 LLM 中的原子事实核查提升医学问答的可靠性与可解释性
计算与语言
2026-01-01 v3 人工智能
摘要
大型语言模型(LLM)展现出丰富的医学知识,但容易产生幻觉和引用不准确,这对其临床应用和监管合规构成了挑战。当前的方法,如检索增强生成,通过将答案建立在源文档基础上来部分解决这些问题,但幻觉和较低的事实级可解释性依然存在。在这项工作中,我们引入了一种新颖的原子事实核查框架,旨在增强用于医学长文本问答的 LLM 的可靠性和可解释性。该方法将 LLM 生成的响应分解为离散的、可验证的单元,称为原子事实,每个单元都根据权威的医学指南知识库进行独立验证。这种方法能够对错误进行针对性纠正,并直接溯源至源文献,从而提高了医学问答的事实准确性和可解释性。通过医学专家的多读者评估和自动化开放问答基准测试进行的广泛评估表明,事实准确性和可解释性均有显著提升。我们的框架实现了高达 40% 的整体答案改进和 50% 的幻觉检测率。将每个原子事实追溯至数据库中最相关片段的能力,为生成的响应提供了细粒度、透明的解释,弥补了当前医学人工智能应用中的一个主要空白。这项工作代表了迈向更值得信赖和可靠的 LLM 临床应用的关键一步,满足了临床应用的关键前提条件,并增强了对人工智能辅助医疗的信心。
引用
@article{arxiv.2505.24830,
title = {Improving Reliability and Explainability of Medical Question Answering through Atomic Fact Checking in Retrieval-Augmented LLMs},
author = {Juraj Vladika and Annika Domres and Mai Nguyen and Rebecca Moser and Jana Nano and Felix Busch and Lisa C. Adams and Keno K. Bressem and Denise Bernhardt and Stephanie E. Combs and Kai J. Borm and Florian Matthes and Jan C. Peeken},
journal= {arXiv preprint arXiv:2505.24830},
year = {2026}
}
备注
18 pages, 7 figures and tables