中文

RAN得分:基于大语言模型的放射学报告生成评估得分

人工智能 2026-03-25 v1 人机交互

摘要

胸部X光报告生成和自动化评估受限于对低发病率异常的识别不足以及对临床重要语言(包括否定和模糊性)的处理不当。我们发展了一种以临床医生为导向的框架,结合人类专业知识和大语言模型,用于从自由文本胸部X光报告中进行多标签 finding 提取,并据此定义 RAN得分,这是一个用于报告评估的 finding 级别指标。我们使用来自公共胸部X光数据集的三个非重叠 MIMIC-CXR-EN 队列以及独立的 ChestX-CN 验证队列,优化提示词,建立放射医生推导的参考标签并评估报告生成模型。优化后的框架在 MIMIC-CXR-EN 开发队列上将宏平均得分从 0.753 提升至 0.956,在直接可比标签上超过 CheXbert基准 15.7个百分点,并在 ChestX-CN 验证队列上表现出稳健的泛化能力。我们展示了临床医生导向的提示优化提高了与放射医生推导参考标准的一致性,以及 RAN得分如何实现对报告忠诚度的 finding 级别评估,特别是在处理低发病率异常方面。

关键词

引用

@article{arxiv.2603.22935,
  title  = {Ran Score: a LLM-based Evaluation Score for Radiology Report Generation},
  author = {Ran Zhang and Yucong Lin and Zhaoli Su and Bowen Liu and Danni Ai and Tianyu Fu and Deqiang Xiao and Jingfan Fan and Yuanyuan Wang and Mingwei Gao and Yuwan Hu and Shuya Gao and Jingtao Li and Jian Yang and Hong Song and Hongliang Sun},
  journal= {arXiv preprint arXiv:2603.22935},
  year   = {2026}
}

备注

4 pages, 5 figures