VERT:面向放射学报告评估的可靠大语言模型评判器
人工智能
2026-04-07 v1 计算与语言
摘要
当前关于放射学报告评估的文献主要集中于设计基于大语言模型(LLM)的指标,并针对胸部 X 光片微调小型模型。然而,这些方法在应用于其他模态和解剖部位的报告时是否稳健,目前尚不清楚。哪种模型和提示配置最适合作为放射学评估的 LLM 评判器?我们对专家评分与基于 LLM 的评分进行了全面的相关性分析。我们比较了三种现有的 LLM 作为评判器指标(RadFact、GREEN 和 FineRadScore)以及我们提出的基于 LLM 的指标 VERT,在涵盖多种模态和解剖部位的两个专家标注数据集(RadEval 和 RaTE-Eval)上,使用了不同规模的开源和闭源模型(包括推理型和非推理型)。我们进一步利用 RaTE-Eval 评估了小样本方法、集成学习以及参数高效微调。为了更好地理解指标行为,我们进行了一项系统的错误检测与分类研究,以评估这些指标与专家判断的一致性,并识别出较低和较高一致性的领域。我们的结果表明,与 GREEN 相比,VERT 将与放射科医师判断的相关性相对提高了 11.7%。此外,仅使用 1300 个训练样本微调 Qwen3 30B 模型,性能提升高达 25%。微调后的模型还将推理时间缩短了多达 37.2 倍。这些发现凸显了基于 LLM 的评判器的有效性,并证明通过轻量级适配即可实现可靠的评估。
引用
@article{arxiv.2604.03376,
title = {VERT: Reliable LLM Judges for Radiology Report Evaluation},
author = {Federica Bologna and Jean-Philippe Corbeil and Matthew Wilkens and Asma Ben Abacha},
journal= {arXiv preprint arXiv:2604.03376},
year = {2026}
}