中文

GPT-4用于胸部X射线印象生成评估:一项关于性能与感知的读者研究

计算与语言 2023-12-27 v1

摘要

多模态基础模型卓越的生成能力目前正在被探索用于多种应用。生成放射学印象是一项具有挑战性的任务,可能显著减轻放射科医生的工作负担。在我们的研究中,我们探索并分析了GPT-4在胸部X射线印象生成方面的生成能力。为基于不同输入模态(图像、文本、文本与图像)生成并评估胸部X射线印象,我们对公开可用的NIH数据集中的25个病例撰写了盲法放射学报告。依次向GPT-4提供图像、发现部分或两者以生成依赖于输入的印象。在一项盲法随机阅读中,4名放射科医生对印象进行评分,并被要求分类印象来源(人类、AI),为其判断提供理由。最后,评估了文本模型评价指标及其与放射学评分(4个维度之和)的相关性。根据放射学评分,人类撰写的印象评分最高,尽管与基于文本的印象无显著差异。自动评价指标对图像印象显示出与放射学评分从中度到高度的相关性,但各输入间的单项评分差异极大,表明其对放射学质量的表征不足。AI生成印象的检测因输入而异,基于文本的印象为61%。被分类为AI生成的印象即使由放射科医生撰写,其放射学评分也显著更差,表明存在潜在偏见。我们的研究揭示了根据模型输入的不同,放射学评估与常见自动评价指标之间存在显著不一致。对AI生成发现的检测存在偏见,即高评分印象被感知为人类撰写。

关键词

引用

@article{arxiv.2311.06815,
  title  = {Evaluation of GPT-4 for chest X-ray impression generation: A reader study on performance and perception},
  author = {Sebastian Ziegelmayer and Alexander W. Marka and Nicolas Lenhart and Nadja Nehls and Stefan Reischl and Felix Harder and Andreas Sauter and Marcus Makowski and Markus Graf and Joshua Gawlitza},
  journal= {arXiv preprint arXiv:2311.06815},
  year   = {2023}
}