中文

临床AI评估的案例特定评分标准:方法论、验证与LLM-临床医生一致性(涵盖823例)

人工智能 2026-04-28 v1 计算与语言

摘要

目标。临床AI文档系统需要具备临床有效性、经济可行性并敏感于迭代变化的评估方法论。需要逐实例进行专家审核的方法在安全、迭代部署方面过于缓慢且昂贵。我们提出一种基于案例的、由临床医生编写的评分标准方法论,用于临床AI评估,并检验LLM生成的评分标准是否能近似临床医生一致性。材料与方法。20名临床医生为823例临床案例(其中736例真实场景,87例合成场景)编写了1,646个评分标准,这些案例涵盖 primary care、精神科、肿瘤科和行为健康。每个评分标准都经验证,确认LLM-based评分代理在 consistently 对偏好输出进行高分,对被拒绝的输出进行低分。7个版本的EHR嵌入式AI代理在所有案例中都被评估。结果。临床医生编写的评分标准有效区分了高质量和低质量输出(中位数得分间隔:82.9%),评分稳定性高(中位数范围:0.00%)。中位数得分从84%提升至95%。在后续实验中,临床医生-LLM排序一致性(tau:0.42-0.46)等于或优于临床医生-临床医生一致性(tau:0.38-0.43),归因于 ceiling compression 和LLM评分标准的改进。讨论。这种收敛支持在临床医生编写的评分标准之外 incorpora LLM评分标准。以约1000倍更低的成本,LLM评分标准实现了更大的评估覆盖范围,而持续的临床编写评估以专家判断为基础。Ceiling compression 对未来的inter-rater一致性研究提出了方法学挑战。结论。案例特定评分标准为临床AI评估提供了一条路径,既保留专家判断,又在成本降低三个数量级的同时实现自动化。临床医生编写的评分标准是LLM评分标准的基准。

关键词

引用

@article{arxiv.2604.24710,
  title  = {Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters},
  author = {Aaryan Shah and Andrew Hines and Alexia Downs and Denis Bajet and Paulius Mui and Fabiano Araujo and Laura Offutt and Aida Rutledge and Elizabeth Jimenez},
  journal= {arXiv preprint arXiv:2604.24710},
  year   = {2026}
}

备注

14 pages, 2 figures, 3 tables, submitted to JAMIA