中文

MediEval:面向患者情境与知识 grounding 推理的统一医学基准

计算与语言 2026-05-08 v2 人工智能

摘要

大型语言模型(LLMs)正在医疗领域广泛应用,但由于可靠性和安全性的担忧,其实际应用受到限制。现有的评估要么在孤立环境中测试事实性医学知识,要么在不验证正确性的情况下评估患者层面的推理,这留下了关键性的空白。我们引入 MediEval,一个将 MIMIC-IV 电子健康记录(EHR)链接到由 UMLS 和其他生物医学词汇表构建的统一知识库的基准。MediEval 在真实患者情境中生成多样化的事实性和反事实性医学陈述,使我们能够在涵盖知识 grounding 与情境一致性的 4 象限框架内进行系统评估。通过该框架,我们识别出包括幻觉支持和真理反转等关键失效模式,这些失效模式在当前的专有、开源和领域特定 LLMs 中经常出现。为解决这些风险,我们提出了反事实风险感知微调(CoRFu),这是一种基于 DPO 的方法,采用不对称惩罚以针对不安全的混淆。CoRFu 在基线模型上提升了+16.4个宏平均F1分数,并消除了真理反转错误,显示出更高的准确率和显著更大的安全性。

关键词

引用

@article{arxiv.2512.20822,
  title  = {MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs},
  author = {Zhan Qu and Michael Färber},
  journal= {arXiv preprint arXiv:2512.20822},
  year   = {2026}
}