中文

如何评估医学AI

人工智能 2025-09-26 v2 计算与语言

摘要

将人工智能(AI)集成到医学诊断工作流程中需要稳健且一致的评估方法,以确保其可靠性、临床相关性以及专家判断的内在变异性。传统指标如精确率和召回率往往无法 account for 专家判断的内在变异性,导致对AI性能的评估不一致。像柯氏系数(Cohen's Kappa)这样的跨专家一致性统计更可靠,但缺乏可解释性。我们引入了相对精确率和召回率的算法诊断(RPAD和RRAD)——一种新的评估指标,将AI输出与多个专家意见进行比较,而不是依赖单一参考标准。通过对比AI性能与跨专家 disagreement 的归一化,这些指标提供了更稳定、更真实的预测诊断质量度量。除了综合分析诊断质量度量外,我们的研究还包含一个重要的副结果。我们的评估方法允许我们避免从有限列表中选择诊断来评估给定案例。相反,正在测试的模型和验证员都得出自由形式的诊断。在建立自由形式临床诊断身份的自动化方法中,达到98%的准确率变得可实现。我们使用360个医学对话进行了评估,将多个大语言模型(LLM)与一组医生进行比较。大规模研究表明,像DeepSeek-V3这样的顶尖模型在准确性上与专家共识持平或超过。此外,我们展示了专家判断显示显著的变异性——往往大于AI与人类之间的变异性。这一发现凸显了任何绝对指标的局限性,支持在医学AI中采用相对指标的必要性。

关键词

引用

@article{arxiv.2509.11941,
  title  = {How to Evaluate Medical AI},
  author = {Ilia Kopanichuk and Petr Anokhin and Vladimir Shaposhnikov and Vladimir Makharev and Ekaterina Tsapieva and Iaroslav Bespalov and Dmitry V. Dylov and Ivan Oseledets},
  journal= {arXiv preprint arXiv:2509.11941},
  year   = {2025}
}

备注

10 pages, 7 fugures