GEMA-Score:用于放射学报告评估的颗粒化可解释多智能体评分框架
计算与语言
2025-08-06 v2 多智能体系统
摘要
自动医学报告生成有望支持临床诊断、减轻放射科医生的工作量,并展现出提升诊断一致性的潜力。然而,当前的评估指标往往无法反映生成报告的临床可靠性。早期基于重叠的方法侧重于预测实体与真实实体之间的文本匹配,但忽略了细粒度的临床细节(例如解剖位置、严重程度)。一些诊断指标受限于固定词汇表或模板,降低了其捕捉多样化临床表达的能力。基于 LLM 的方法进一步缺乏可解释的推理步骤,使得在安全关键场景中难以评估或信任其行为。这些局限性阻碍了对生成报告可靠性的全面评估,并给其在临床应用中的选择带来风险。因此,我们在本文中提出了一种颗粒化可解释多智能体评分(GEMA-Score),通过基于大语言模型的多智能体工作流进行客观量化和主观评估。我们的 GEMA-Score 解析结构化报告,并通过智能体之间交互式的信息交换采用稳定的计算方法,以评估疾病诊断、位置、严重程度和不确定性。此外,基于 LLM 的评分智能体会评估完整性、可读性和临床术语,同时提供解释性反馈。大量实验验证了 GEMA-Score 在公开数据集上与人类专家评估实现了最高相关性,证明了其在临床评分中的有效性(ReXVal 数据集的 Kendall 系数 = ,RadEvalX 数据集的 Kendall 系数 = )。匿名项目演示地址:https://github.com/Zhenxuan-Zhang/GEMA_score。
引用
@article{arxiv.2503.05347,
title = {GEMA-Score: Granular Explainable Multi-Agent Scoring Framework for Radiology Report Evaluation},
author = {Zhenxuan Zhang and Kinhei Lee and Peiyuan Jing and Weihang Deng and Huichi Zhou and Zihao Jin and Jiahao Huang and Zhifan Gao and Dominic C Marshall and Yingying Fang and Guang Yang},
journal= {arXiv preprint arXiv:2503.05347},
year = {2025}
}