中文

粉碎捷径:面向 LLMs 多跳医学推理的拓扑正则化基准

计算与语言 2026-03-16 v1 人工智能

摘要

虽然大语言模型(LLMs)在标准医学基准上通过单跳事实记忆实现专家水平,但在真实临床环境中所需的复杂多跳诊断推理方面严重受限。主要障碍是“捷径学习”,即模型在知识图谱中利用高度连通的通用枢纽节点(如“炎症”)来规避真实的微观病理级联。为此,我们引入 ShatterMed-QA,一个包含 10,558 个多跳临床问题的双语基准,旨�严格评估深层诊断推理。我们的框架采用新颖的 kk-Shattering 算法,对医学知识图谱进行拓扑正则化,通过物理性剪枝通用枢纽来显式切断逻辑捷径。我们通过应用隐式桥接实体遮蔽和拓扑驱动的硬负采样来合成评估情景,迫使模型在不依赖表面消除的情况下导航生物学上可信的干扰项。对 21 个 LLMs 的全面评估显示,其在多跳任务上的表现大幅下降,尤其是针对领域特定模型。关键的是,通过检索增强生成(RAG)恢复被遮蔽的证据,会触发近乎普遍的性能恢复,验证了 ShatterMed-QA 结构的忠实性,并证明其在诊断当前医学 AI 根本推理缺陷方面的有效性。详述数据集、交互示例及完整排行榜,请访问我们的项目网站:https://shattermed-qa-web.vercel.app/。

关键词

引用

@article{arxiv.2603.12458,
  title  = {Shattering the Shortcut: A Topology-Regularized Benchmark for Multi-hop Medical Reasoning in LLMs},
  author = {Xing Zi and Xinying Zhou and Jinghao Xiao and Catarina Moreira and Mukesh Prasad},
  journal= {arXiv preprint arXiv:2603.12458},
  year   = {2026}
}