从检索到生成:统一医学问答中的外部知识与参数化知识
计算与语言
2025-10-22 v1 人工智能
摘要
医学问答(QA)需要广泛访问领域特定知识。一个有前景的方向是通过检索来自医学语料库的外部知识或依赖于存储在模型参数中的参数化知识来增强大型语言模型(LLM)。现有方法通常分为两类:检索增强生成(RAG),该方法以检索到的外部证据为推理依据;以及生成增强生成(GAG),该方法仅依赖模型的内部知识生成情境文档。然而,RAG 常受噪声或不完整检索的影响,而 GAG 因受限生成而容易产生幻觉或不准确的信息。这两个问题都可能误导推理并削弱答案的可靠性。为解决这些挑战,我们提出了 MedRGAG,一个统一检索-生成增强框架,用于医学 QA。MedRGAG 包含两个关键模块:知识引导的上下文完成(KGCC),该模块引导生成器产生补充检索揭示的缺失知识的背景文档;以及知识感知的文件选择(KADS),该模块自适应地选择检索文档和生成文档的最优组合,以形成简洁而全面的证据用于答案生成。在五个医学 QA 基准测试上的大规模实验表明,MedRGAG 在 MedRAG 上的提升达到12.5%,在 MedGENIE 上的提升达到4.5%,凸显了统一检索和生成以实现知识密集型推理的有效性。我们的代码和数据已公开于 https://anonymous.4open.science/r/MedRGAG。
引用
@article{arxiv.2510.18297,
title = {From Retrieval to Generation: Unifying External and Parametric Knowledge for Medical Question Answering},
author = {Lei Li and Xiao Zhou and Yingying Zhang and Xian Wu},
journal= {arXiv preprint arXiv:2510.18297},
year = {2025}
}
备注
13 pages, 4 figures