中文

ReXamine-Global:揭示放射学报告生成指标不一致性的框架

机器学习 2024-08-30 v1 计算与语言

摘要

鉴于生成式AI模型在放射学领域的快速发展,亟需能准确衡量不同医院AI生成放射学报告质量的robust 指标。我们开发了ReXamine-Global,一个由LLM驱动的多站点框架,用于测试不同写作风格和患者群体中的指标,暴露其泛化性差距。首先,我们的方法测试指标是否对报告写作风格敏感,即whether AI生成的报告在写作风格上与ground-truth相似或不相似时会得出不同分数。其次,我们的方法衡量指标是否可靠地与专家达成一致,或者指标和专家评分是否对某些医院的AI生成报告质量产生分歧。我们使用来自6家全球医院的240份报告,应用ReXamine-Global于7个既定的报告评估指标,发现其泛化性严重不足。开发者可以在设计新报告评估指标时应用ReXamine-Global,以确保其在不同站点的robust性。此外,我们的分析可指导使用这些指标的用户,选择在其感兴趣的站点可靠工作的评估程序。

关键词

引用

@article{arxiv.2408.16208,
  title  = {ReXamine-Global: A Framework for Uncovering Inconsistencies in Radiology Report Generation Metrics},
  author = {Oishi Banerjee and Agustina Saenz and Kay Wu and Warren Clements and Adil Zia and Dominic Buensalido and Helen Kavnoudias and Alain S. Abi-Ghanem and Nour El Ghawi and Cibele Luna and Patricia Castillo and Khaled Al-Surimi and Rayyan A. Daghistani and Yuh-Min Chen and Heng-sheng Chao and Lars Heiliger and Moon Kim and Johannes Haubold and Frederic Jonske and Pranav Rajpurkar},
  journal= {arXiv preprint arXiv:2408.16208},
  year   = {2024}
}