中文

GPT-4V 医学图像分析多模态能力的系统性评估

计算机视觉与模式识别 2024-02-01 v5 人工智能

摘要

本工作对 GPT-4V 的医学图像分析多模态能力进行了评估,重点关注放射学报告生成、医学视觉问答和医学视觉定位三项代表性任务。在评估中,为每个任务设计了一组提示以诱导 GPT-4V 的相应能力产生足够好的输出。采用了定量分析、人工评估和案例研究三种评估方式,以实现深入而广泛的评估。我们的评估表明,GPT-4V 在理解医学图像方面表现出色,能够生成高质量的放射学报告并有效回答有关医学图像的问题。同时,发现其医学视觉定位性能仍有待大幅改进。此外,我们观察到定量分析的评估结果与人工评估结果之间存在差异。这一差异表明,传统指标在评估 GPT-4V 等大型语言模型性能方面存在局限性,且有必要开发用于自动定量分析的新指标。

关键词

引用

@article{arxiv.2310.20381,
  title  = {A Systematic Evaluation of GPT-4V's Multimodal Capability for Medical Image Analysis},
  author = {Yingshu Li and Yunyi Liu and Zhanyu Wang and Xinyu Liang and Lei Wang and Lingqiao Liu and Leyang Cui and Zhaopeng Tu and Longyue Wang and Luping Zhou},
  journal= {arXiv preprint arXiv:2310.20381},
  year   = {2024}
}