中文

ClinicalBench:跨转诊临床问答中基于断言感知检索的压力测试

机器学习 2026-05-13 v1

摘要

推理基准在干净输入上衡量临床性能。我们评估推理前的步骤:在真实EHR笔记上进行检索,其中否定、时态和家族-患者归因可使正确答案翻转为错误答案。EpiKG为每个事实配备断言标签和时态标签,然后按问题意图路由检索。ClinicalBench覆盖43名MIMIC-IV患者的400个问题,涵盖9个断言敏感类别。7条件消检验检验EpiKG的每个组成部分,对6个LLM(Claude Opus 4.6、GPT-OSS 20B、MedGemma 27B、Gemma 4 31B、MedGemma 1.5 4B、Qwen 3.5 35B)进行测试。三位医生盲审100个配对题目。作者-blind的primary endpoint,对50个unanimous-strict项目进行leave-author-out配对exact McNemar检验,结果提升+22.0个百分点(95% Newcombe CI [+5.1, +31.5], p=0.0192)。架构创新点是意图感知KG-RAG相对于Contriever dense-RAG基线(C2b到C4g_kw在排除变更n=362的终点)提升+8.84个百分点(配对McNemar p=1.79e-3);在oracle意图下提升+12.43个百分点。三位评审者的灵敏度方向一致:三位评审者多数+24.0个百分点(受单一作者循环依赖影响);确定性关键词可重复性代理+39.5个百分点。在六个模型中,提升随LLM单独基线提升而缩小(beta=-1.123, r=-0.921, p=0.009)。在n=6的情况下,这更像是回归均值而非编码替代模型规模。医师评审确定66%的自动生成参考答案有缺陷,这一方法学发现表明NLP管道临床-QA基准需要医师评审才能可用。ClinicalBench、冻结评估器、三位评审数据以及EpiKG输出堆栈均公开释放。

关键词

引用

@article{arxiv.2605.11142,
  title  = {Rank Is Not Capacity: Spectral Occupancy for Latent Graph Models},
  author = {Nikolaos Nakis and Panagiotis Promponas and Konstantinos Tsirkas and Katerina Mamali and Eftychia Makri and Leandros Tassiulas and Nicholas A. Christakis},
  journal= {arXiv preprint arXiv:2605.11142},
  year   = {2026}
}

备注

Preprint