中文

基于知识图谱评估医学 LLM 响应的自动事实核查

机器学习 2025-12-22 v2

摘要

大型语言模型 (LLM) 的近期快速涌现为医疗领域的各种任务提供了强大的能力。然而,要将 LLM 部署到高风险的医疗环境中,仍需对其潜在风险进行严格的验证和验证以进行充分了解。本文探讨了使用医学知识图谱 (KG) 对 LLM 生成响应的可靠性和可行性进行自动事实核查评估。为支撑这一调查,我们引入了 FAITH 框架,用于系统性地探讨该 KG 基于方法的优势和局限性。FAITH 无需参考答案,即可通过将响应分解为原子性声明、将其链接到医学 KG,并基于证据路径对其进行评分来实现。针对 diverse medical tasks 的实验中包含人类主观评估,结果表明 KG 基于评估在与临床医生判断的相关性方面显著高于其他方法,并且能够有效区分具有不同能力的 LLM。该方法对文本变体也具有鲁棒性。其评分的内在可解释性进一步有助于用户理解和缓解当前 LLM 的局限性。我们得出结论,尽管存在局限性,但利用 KG 是医疗领域自动事实核查评估的突出方向。

关键词

引用

@article{arxiv.2511.12817,
  title  = {Assessing Automated Fact-Checking for Medical LLM Responses with Knowledge Graphs},
  author = {Shasha Zhou and Mingyu Huang and Jack Cole and Charles Britton and Ming Yin and Jan Wolber and Ke Li},
  journal= {arXiv preprint arXiv:2511.12817},
  year   = {2025}
}

备注

Accepted as a conference paper at AAAI'26