ReFINE:用于放射学报告生成的奖励驱动的可解释细粒度评估框架
计算与语言
2025-02-14 v2 人工智能
摘要
自动化放射学报告生成(R2Gen)取得了显著进展,但其复杂性带来了评估准确性的挑战。传统指标常通过依赖刚性词匹配或仅关注病理实体而不足,导致与人类评估不一致。为弥合这一差距,我们提出了ReFINE——一个专为R2Gen设计的自动评估指标。该指标利用奖励模型,由我们设计的基于边际的奖励约束损失驱动,并通过量身定制的训练数据设计,使其能够根据用户定义的需求自定义评估标准。它不仅根据用户指定的标准对报告进行评分,还提供详细的子得分,从而增强可解释性,使用户能够在报告的不同方面之间调整评估标准。借助GPT-4,我们设计了一个易于使用的数据生成管道,使我们能够基于两种不同的评分系统生成大量训练数据,这些数据包含不同质量的报告及其相应的得分。这些GPT生成的报告通过我们的配对规则被配对为接受样本和拒绝样本,以训练一个LLM以实现我们的细粒度奖励模型,该模型为质量较高的报告分配更高的奖励。我们的奖励控制损失使该模型能够同时输出对应评估标准数量的多个独立奖励,其求和即为最终的ReFINE。我们的实验表明,ReFINE与人类判断的关联性更高,在模型选择方面表现优于传统指标。值得注意的是,我们的模型提供整体得分以及每个评估项目的单独得分,从而增强了可解释性。我们还展示了其在各种评估系统中的灵活训练能力。
引用
@article{arxiv.2411.17301,
title = {ReFINE: A Reward-Based Framework for Interpretable and Nuanced Evaluation of Radiology Report Generation},
author = {Yunyi Liu and Yingshu Li and Zhanyu Wang and Xinyu Liang and Lingqiao Liu and Lei Wang and Luping Zhou},
journal= {arXiv preprint arXiv:2411.17301},
year = {2025}
}