临床 AI 的源头差距:基于证据可追溯时序知识图的罕见疾病推理
计算与语言
2026-05-05 v2
摘要
前沿大型语言模型生成临床准确输出,但其引用常被捏造。我们称之为源头差距。我们在 36 个临床验证情景中测试了五个前沿 LLM,用于三个罕见肌肉神经疾病的配对。没有模型在不提示的情况下会产生临床相关的 PubMed 标识符。当被明确要求引用时,最佳模型实现 15.3% 的相关 PMID;大多数引用指向与无关领域的真实出版物。我们提出了 HEG-TKG(分层证据 grounding 时序知识图),该系统将临床主张 grounding在由 4,512 篇 PubMed 记录和策源来源构建的时序知识图上,采用质量分层分层和 1,280 条疾病轨迹里程碑。对于相同的合成模型,在受控三臂比较中,HEG-TKG 在保持基线临床特征覆盖率的同时,实现 100% 的证据可验证性,并配备 203 条内联引用。Guideline-RAG 给定重叠的原始文档作为文本,产生零个可验证引用。LLM 评判器在没有 PubMed 审计数据的情况下无法区分捏造的引用和已验证的引用。独立临床评估确认了可验证性优势(Cohen's d = 1.81, p < 0.001),且未在安全性或完整性方面产生下降。反事实实验显示该系统对注入的临床错误具有 80% 的抗性,并通过引用轨迹实现 100% 的检测。该系统部署在本地以开源模型实现,患者数据永远不会离开机构基础设施。
引用
@article{arxiv.2604.17114,
title = {The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning},
author = {Md Shamim Ahmed and Maja Dusanic and Moritz Nikolai Kirschner and Elisabeth Nyoungui and Jana Zschüntzsch and Lukas Galke Poech and Richard Röttger},
journal= {arXiv preprint arXiv:2604.17114},
year = {2026}
}
备注
32 pages, 9 figures, 7 tables. Will submit to npj Digital Medicine. Supplementary materials included