MedProbeBench:面向专家级医学指南的深度证据集成系统性基准测试
计算机视觉与模式识别
2026-04-21 v1
摘要
近年来,深度研究系统的进展使大型语言模型能够检索、综合和推理大规模外部知识。在医学领域,发展临床指南严重依赖此类深度证据集成。然而,现有基准测试未能在需要多步骤证据集成和专家级判断的真实工作流程中,对此能力进行评估。为填补这一空白,我们引入 MedProbeBench,第一个以高质量临床指南作为专家级参考的 benchmark。医学指南在中立性和可验证性方面具有严格标准,代表了医学专家权威,对深度研究智能体构成重大挑战。为进行评估,我们提出 MedProbe-Eval,一个综合性评估框架,包括:(1) 整体评分标准——1200 多项任务自适应评分标准用于全面质量评估;(2) 细粒度证据验证——基于 5130 多条原子命题进行严格的证据精确度验证。评估 17 个大型语言模型和深度研究智能体,揭示了证据集成和指南生成方面的关键缺口,凸显当前能力与专家级临床指南开发之间仍存显著鸿沟。项目:https://github.com/uni-medical/MedProbeBench
引用
@article{arxiv.2604.18418,
title = {MedProbeBench: Systematic Benchmarking at Deep Evidence Integration for Expert-level Medical Guideline},
author = {Jiyao Liu and Jianghan Shen and Sida Song and Tianbin Li and Xiaojia Liu and Rongbin Li and Ziyan Huang and Jiashi Lin and Junzhi Ning and Changkai Ji and Siqi Luo and Wenjie Li and Chenglong Ma and Ming Hu and Jing Xiong and Jin Ye and Bin Fu and Ningsheng Xu and Yirong Chen and Lei Jin and Hong Chen and Junjun He},
journal= {arXiv preprint arXiv:2604.18418},
year = {2026}
}