中文

ClinConsensus:面向中文医学 LLM 的医生校准临床评估基准

计算与语言 2026-05-28 v5

摘要

开放式医学 LLM 评估在医生校准的临床相关响应标准覆盖上仍显薄弱,尤其在当地临床场景中。我们提出\textsc{ClinConsensus},一个包含2500个专家精选案例的中文医学基准,覆盖36个医学专科、12个任务主题、多个难度层次以及面向普通人和专业人士的场景。每个案例均配有30个案例特定的二元评估标准。为评估响应是否满足足够多的医生编写的标准,我们提出\emph{医生锚定覆盖评分}(Clinician-Anchored Coverage Score, CACS),在k=10处实例化为阈值指标,并开发了结合GPT-5.1评分器与医生监督的Qwen3-8B评判器的双评判框架。评估了11个前沿 LLM,我们发现持续的覆盖差距:评估准确率范围为39.6%至52.1%,而CACS@10范围为17.8%至32.9%,导致模型之间存在19.2至21.9分的差距。分层分析进一步揭示了在推理、证据使用、结构化提取、用药指示、随访和对话寄语等方面的显著差异。这些结果表明,医学 LLM 评估应衡量基于阈值的、以评估标准为依据的临床覆盖率,而非平均部分正确性。

关键词

引用

@article{arxiv.2603.02097,
  title  = {ClinConsensus: A Physician-Calibrated Benchmark for Evaluating Clinical Rubric Coverage in Chinese Medical LLMs},
  author = {Xiang Zheng and Han Li and Wenjie Luo and Weiqi Zhai and Yiyuan Li and Chuanmiao Yan and Xue Yang and Kailuan Wu and Ruyi Xu and Tianyun Lu and Tianyi Tang and Yubo Ma and Kexin Yang and Dayiheng Liu and Sen Yang and Lin Qu and Bing Zhao and Hu Wei},
  journal= {arXiv preprint arXiv:2603.02097},
  year   = {2026}
}