中文

基于临床基础的智能体报告评估:一种可解释的放射学报告生成度量标准

计算与语言 2025-08-06 v1 人工智能 机器学习

摘要

放射学成像是诊断、治疗规划和临床决策的核心。视觉语言基础模型激发了人们对自动放射学报告生成(RRG)的兴趣,但安全部署要求对生成的报告进行可靠的临床评估。现有度量标准通常依赖于表面相似性或表现为黑盒,缺乏可解释性。我们提出了 ICARE(可解释且基于临床基础的智能体报告评估,Interpretable and Clinically-grounded Agent-based Report Evaluation),这是一个利用大语言模型智能体和动态多选题问答(MCQA)的可解释评估框架。两个智能体分别持有真实报告或生成报告,生成具有临床意义的问题并互相提问。对答案的一致性反映了检查结果的保留情况和一致性,作为临床精确率和召回率的可解释代理指标。通过将分数与问答对相关联,ICARE 实现了透明且可解释的评估。临床医生研究表明,ICARE 与专家判断的一致性显著高于先前的度量标准。扰动分析证实了其对临床内容和可重复性的敏感性,而模型比较则揭示了可解释的错误模式。

关键词

引用

@article{arxiv.2508.02808,
  title  = {Clinically Grounded Agent-based Report Evaluation: An Interpretable Metric for Radiology Report Generation},
  author = {Radhika Dua and Young Joon and Kwon and Siddhant Dogra and Daniel Freedman and Diana Ruan and Motaz Nashawaty and Danielle Rigau and Daniel Alexander Alber and Kang Zhang and Kyunghyun Cho and Eric Karl Oermann},
  journal= {arXiv preprint arXiv:2508.02808},
  year   = {2025}
}