MRScore:利用基于 LLM 的奖励系统评估放射学报告生成
计算与语言
2024-04-30 v1 人工智能
摘要
近年来,自动放射学报告生成经历了显著增长。本文介绍了 MRScore,一种通过利用大语言模型为放射学报告生成量身定制的自动评估指标。本文的系统性观察表明,像 BLEU 这样的传统 NLG(自然语言生成)指标不足以准确评估生成的放射学报告。为了应对这一挑战,我们与放射科医师合作开发了一个指导 LLM 进行放射学报告评估的框架,确保与人类分析保持一致。我们的框架包含两个关键组件:i) 利用 GPT 生成大量训练数据,即不同质量的报告;ii) 将 GPT 生成的报告配对为接受和拒绝样本,并训练 LLM 以产生 MRScore 作为模型奖励。我们的实验表明,与传统指标相比,MRScore 与人类判断的相关性更高,在模型选择方面表现更优。我们的代码和数据集将在 GitHub 上提供。
引用
@article{arxiv.2404.17778,
title = {MRScore: Evaluating Radiology Report Generation with LLM-based Reward System},
author = {Yunyi Liu and Zhanyu Wang and Yingshu Li and Xinyu Liang and Lingqiao Liu and Lei Wang and Luping Zhou},
journal= {arXiv preprint arXiv:2404.17778},
year = {2024}
}