中文

GREEN:生成式放射学报告评估与错误标注

计算与语言 2025-01-23 v2 人工智能

摘要

评估放射学报告是一个具有挑战性的问题,因为由于需要关于医学图像的准确医学沟通,事实正确性极其重要。现有的自动评估指标要么未能考虑事实正确性(例如BLEU和ROUGE),要么在可解释性方面受限(例如F1CheXpert和F1RadGraph)。在本文中,我们介绍了GREEN(生成式放射学报告评估与错误标注),一种放射学报告生成指标,它利用语言模型的自然语言理解来定量和定性地识别和解释候选报告中临床显著的错误。与当前指标相比,GREEN提供:1)与专家偏好一致的分数,2)临床显著错误的人类可解释说明,支持与最终用户的反馈循环,以及3)一种轻量级开源方法,达到商业对应产品的性能。我们通过与GPT-4以及6位专家的错误计数和2位专家的偏好进行比较,验证了我们的GREEN指标。我们的方法不仅显示出与专家错误计数更高的相关性,而且与先前方法相比,同时与专家偏好具有更高的一致性。

关键词

引用

@article{arxiv.2405.03595,
  title  = {GREEN: Generative Radiology Report Evaluation and Error Notation},
  author = {Sophie Ostmeier and Justin Xu and Zhihong Chen and Maya Varma and Louis Blankemeier and Christian Bluethgen and Arne Edward Michalson and Michael Moseley and Curtis Langlotz and Akshay S Chaudhari and Jean-Benoit Delbrouck},
  journal= {arXiv preprint arXiv:2405.03595},
  year   = {2025}
}