GAPS:一个以临床为基础、自动化的AI临床医生评估基准
计算与语言
2025-12-18 v2
摘要
当前用于评估AI临床医生系统的基准,往往基于多项选择题或手动评分标准,无法捕捉实际临床实践所需的深度、鲁棒性和安全性。为此,我们引入GAPS框架,这是一个多维度的评估范式,用于评估Grounding(认知深度)、Adequacy(答案完整性)、Perturbation(鲁棒性)和Safety(安全性)。关键的是,我们开发了一个完全自动化、以指南为导向的管道,用于端到端构建GAPS对齐的基准,克服了以往工作在可扩展性和主观性方面的局限。我们的管道组装证据邻域,创建双图和树表示,并自动生成跨G级别的问题。通过模仿GRADE一致、PICO驱动的证据审查,Rubrics由DeepResearch智能体在ReAct循环中合成。评分由大型语言模型(LLM)评委ensemble执行。验证确认,我们的自动生成问题质量高,与临床医生判断一致(90%一致性,Cohen的Kappa为0.77)。在该基准上评估最先进模型后,揭示了关键失效模式:随着推理深度增加(G轴),性能显著下降;模型在答案完整性方面持久 struggle (A轴);并且对对抗性扰动(P轴)以及某些安全问题(S轴)极其脆弱。这一自动化、临床导向的方法提供了一种可复制且可扩展的方法,用于严格评估AI临床医生系统,并指导其发展以实现更安全、更可靠的临床实践。基准数据集GAPS-NSCLC-preview及评估代码已公开于https://huggingface.co/datasets/AQ-MedAI/GAPS-NSCLC-preview和https://github.com/AQ-MedAI/MedicalAiBenchEval。
引用
@article{arxiv.2510.13734,
title = {GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians},
author = {Xiuyuan Chen and Tao Sun and Dexin Su and Ailing Yu and Junwei Liu and Zhe Chen and Gangzeng Jin and Xin Wang and Jingnan Liu and Hansong Xiao and Hualei Zhou and Dongjie Tao and Chunxiao Guo and Minghui Yang and Yuan Xia and Jing Zhao and Qianrui Fan and Yanyun Wang and Shuai Zhen and Kezhong Chen and Jun Wang and Zewen Sun and Heng Zhao and Tian Guan and Shaodong Wang and Geyun Chang and Jiaming Deng and Hongchengcheng Chen and Kexin Feng and Ruzhen Li and Jiayi Geng and Changtai Zhao and Jun Wang and Guihu Lin and Peihao Li and Liqi Liu and Peng Wei and Jian Wang and Jinjie Gu and Ping Wang and Fan Yang},
journal= {arXiv preprint arXiv:2510.13734},
year = {2025}
}