中文

知识图谱驱动的诊断推理奖励建模:脆弱性与潜力

计算与语言 2025-09-24 v1 人工智能

摘要

大型语言模型 (LLM) 在诊断推理方面显示出潜力,但往往缺乏可靠的、以知识为基础的推理。知识图谱 (KG),如统一医学语言系统 (UMLS),提供了结构化的医学知识,可支持可靠的推理。以往方法通常通过检索增强生成或微调将 KG 集成到提示中,而非实现结构化推理。我们探索了另一种范式:将 LLM 视为 KG 推理路径的奖励模型,模型学习判断候选路径是否为给定患者输入导致正确诊断。这种方法灵感来自最近利用奖励训练来增强模型推理能力的工作,基于计算理论,这表明验证解决方案往往比从零生成一个解决方案更容易。它还类似于医生的诊断评估,他们判断哪些发现和中间条件的序列最有可能支持诊断。我们首先系统评估了五种任务表述和八种训练范式。其次,我们测试了路径判断能力是否可推广到下游诊断任务,包括诊断摘要和医学问答。使用三个开源指令微调 LLM 的实验显示,既有潜力也有脆弱性:尽管特定的奖励优化和蒸馏导致强大的路径判断性能,但对下游任务的可transfer性仍然较弱。我们的发现为对临床 KG 上“奖励模型风格”推理提供了首次的系统性评估,为结构化、基于奖励的监督如何影响 GenAI 系统用于医疗保健的诊断推理提供了见解。

关键词

引用

@article{arxiv.2509.18316,
  title  = {Brittleness and Promise: Knowledge Graph Based Reward Modeling for Diagnostic Reasoning},
  author = {Saksham Khatwani and He Cheng and Majid Afshar and Dmitriy Dligach and Yanjun Gao},
  journal= {arXiv preprint arXiv:2509.18316},
  year   = {2025}
}