CRIMSON:基于临床导向的 LLM 生成放射报告评估指标
计算与语言
2026-03-18 v2 人工智能
计算机视觉与模式识别
摘要
我们介绍 CRIMSON,一个用于胸 X 光报告生成的临床导向评估框架,基于诊断正确性、情境相关性和患者安全进行评估。不同于先前方法,CRIMSON 包含完整的临床背景,包括患者年龄、指征以及基于指南的决策规则,防止正常或临床可忽略的发现对整体得分产生不成比例的影响。该框架将错误分为覆盖虚发现、遗漏发现以及八类属性级错误(如位置、严重程度、测量和诊断过度解释)。每个发现被分配临床重要性等级(紧急、可操作非紧急、不可操作或预期/良性),基于与执业心肺胸放射科医生合作开发的指南,实现以严重性为导向的加权,优先考虑临床后果显著的错误而非良性差异。CRIMSON 通过强大的与临床显著错误计数的对齐验证(6 位执业放射科医生在 ReXVal 中的 Kendall's tau = 0.61-0.71; Pearson's r = 0.71-0.84),以及我们引入的两个额外基准进行验证。在 RadJudge 中,针对临床挑战性通过-否场景的套件,CRIMSON 与专家判断保持一致。在 RadPref 中,规模为 100 多对的放射科偏好基准,包含结构化错误分类、严重性建模和来自 3 位执业心肺胸放射科医生的 1-5 整体质量评分,C R I M S O N 实现了与放射科医生偏好的最强对齐。我们公开发布该指标、评估基准、RadJudge 和 RadPref,以及一个精调后的 MedGemma 模型,以支持社区对报告生成进行可重复评估,所有内容均可在 https://github.com/rajpurkarlab/CRIMSON 获取。
引用
@article{arxiv.2603.06183,
title = {CRIMSON: A Clinically-Grounded LLM-Based Metric for Generative Radiology Report Evaluation},
author = {Mohammed Baharoon and Thibault Heintz and Siavash Raissi and Mahmoud Alabbad and Mona Alhammad and Hassan AlOmaish and Sung Eun Kim and Oishi Banerjee and Pranav Rajpurkar},
journal= {arXiv preprint arXiv:2603.06183},
year = {2026}
}