中文

RAG 增强医疗 LLM 中的领域特定知识图谱

计算与语言 2026-01-23 v1

摘要

大型语言模型能够生成流畅的回答,但在可信赖的、领域特定的推理方面可能会遇到困难。我们评估了领域知识图谱是否能够改善医疗保健领域的检索增强生成(RAG),方法是构建三个源自 PubMed 的图谱:G1\mathbb{G}_1(T2DM)、G2\mathbb{G}_2(阿尔茨海默病)和 G3\mathbb{G}_3(AD+T2DM)。我们设计了两个探针:探针 1 针对合并的 AD T2DM 知识,而探针 2 针对的是 G1\mathbb{G}_1G2\mathbb{G}_2 的交集。七个指令微调 LLM 在检索源 {No-RAG, G1\mathbb{G}_1, G2\mathbb{G}_2, G1\mathbb{G}_1 + G2\mathbb{G}_2, G3\mathbb{G}_3, G1\mathbb{G}_1+G2\mathbb{G}_2 + G3\mathbb{G}_3} 和三个解码温度下进行了测试。结果表明,探针与 KG 之间的范围对齐是决定性的:精确的、范围匹配的检索(特别是 G2\mathbb{G}_2)产生最一致的增益,而不加区分的图谱联合通常会引入干扰因素从而降低准确性。较大的模型在探针 1 上经常使用 No-RAG 基线匹配或超过 KG-RAG,表明其具有强大的参数化先验,而较小/中型模型从范围明确的检索中获益更多。温度起次要作用;较高的值很少有帮助。我们得出结论,精度优先、范围匹配的 KG-RAG 优于广度优先的联合,并且我们概述了图谱选择、模型大小调整和检索/重排序的实用指南。代码和数据可在此处获取 - https://github.com/sydneyanuyah/RAGComparison

关键词

引用

@article{arxiv.2601.15429,
  title  = {Domain-Specific Knowledge Graphs in RAG-Enhanced Healthcare LLMs},
  author = {Sydney Anuyah and Mehedi Mahmud Kaushik and Hao Dai and Rakesh Shiradkar and Arjan Durresi and Sunandan Chakraborty},
  journal= {arXiv preprint arXiv:2601.15429},
  year   = {2026}
}