衡量何谓重要:医疗领域生成式、多模态与智能体 AI 的基准测试
人工智能
2026-05-12 v1
摘要
AI 模型正日益部署在实际临床环境中,必须在复杂且高风险的工作流程中可靠地运行,这些工作流程原本并非标准训练和验证数据集所设计的。评估这些系统需要基准测试:结构化的任务、数据集和指标的组合,使其能够实现可重复、可比较的测量,以衡量模型能做什么。医疗 AI 的核心挑战不在于性能本身,而在于缺乏系统性的方法来测量在真实世界条件下的可靠性、安全性和临床相关性。大多数现有基准测试仅测试模型了解什么;很少测试模型是否能在完整复杂的临床任务中可靠地运行且不失败。当前基准测试是通过非系统化的数据集构建而成,其目标是针对狭窄任务性能进行优化:前沿模型在医学执照考试上几乎完美,但在实际临床任务上评估时性能急剧下降,分别在文档记录、临床决策支持和行政/工作流程任务上的得分分别为 0.74--0.85、0.61--0.76 和 0.53--0.63。高基准测试得分会给人一种部署准备就绪的错觉,而性能与实际效用之间的差距正随着 AI 系统承担更重要临床角色而扩大。没有原则性的基准测试设计框架,领域将无法确定差异的临床性能是源于模型局限性还是性能衡量方式的失效。
引用
@article{arxiv.2605.08445,
title = {Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare},
author = {Prasanna Desikan and Harshit Rajgarhia and Shivali Dalmia and Ananya Mantravadi},
journal= {arXiv preprint arXiv:2605.08445},
year = {2026}
}