图像感知的医学报告生成评估
计算机视觉与模式识别
2024-10-24 v1
摘要
本文提出了一种用于X光图像自动医学报告生成的新型评估指标VLScore。该指标旨在克服现有评估方法的局限性,这些方法要么仅关注文本相似性而忽略临床方面,要么仅关注单一临床方面(病理学)而忽略所有其他因素。我们指标的核心思想是在考虑对应图像的情况下测量放射学报告之间的相似性。我们通过在一个由放射科医生标注报告对错误的数据集上进行评估,证明了该指标的优越性,结果显示其与放射科医生的判断高度一致。此外,我们提供了一个用于评估指标的新数据集。该数据集包含精心设计的扰动,能够区分重要修改(例如,删除诊断)和非重要修改。它揭示了当前评估指标的弱点,并提供了一个清晰的分析框架。
引用
@article{arxiv.2410.17357,
title = {Image-aware Evaluation of Generated Medical Reports},
author = {Gefen Dawidowicz and Elad Hirsch and Ayellet Tal},
journal= {arXiv preprint arXiv:2410.17357},
year = {2024}
}