CP-Env:在可控医院环境中评估临床路径的大语言模型
人工智能
2025-12-15 v2
摘要
医疗护理遵循复杂的临床路径,这些路径超越了孤立的医生-患者互动,强调决策和不同阶段之间的过渡。当前聚焦于静态考试或孤立对话的基准测试不足以评估大语言模型(LLM)在动态临床情境下的表现。我们引入 CP-Env,一个可控的智能体式医院环境,旨在评估 LLM 在完整临床路径上的表现。CP-Env 模拟一个医院生态系统,包含患者和医生智能体,构建从分诊、专科会诊到诊断检测和多学科团队会诊的交互情景。遵循真实医院的自适应流程,使其能够实现分支、长期范围任务执行。我们提出了一个三层评估框架,包括临床疗效、过程能力和职业伦理。结果表明,大多数模型在处理路径复杂性方面存在困难,出现幻觉并丢失关键诊断细节。有趣的是,过度的推理步骤有时会适得其反,而顶尖模型倾向于通过内化知识来减少对工具的依赖。CP-Env 通过全面评估临床路径,推动了医疗 AI 智能体的发展。我们提供了基准数据集和评估工具,可在 https://github.com/SPIRAL-MED/CP_ENV 获取。
引用
@article{arxiv.2512.10206,
title = {CP-Env: Evaluating Large Language Models on Clinical Pathways in a Controllable Hospital Environment},
author = {Yakun Zhu and Zhongzhen Huang and Qianhan Feng and Linjie Mu and Yannian Gu and Shaoting Zhang and Qi Dou and Xiaofan Zhang},
journal= {arXiv preprint arXiv:2512.10206},
year = {2025}
}