中文

面向医疗应用的多模态ChatGPT:GPT-4V的实验研究

计算机视觉与模式识别 2023-10-31 v1

摘要

在本文中,我们批判性评估了最先进的多模态大语言模型,即带视觉功能的GPT-4(GPT-4V),在视觉问答(VQA)任务上的能力。我们的实验利用来自11种模态(如显微镜、皮肤镜、X射线、CT等)的病理学与放射学数据集以及15个感兴趣对象(脑、肝、肺等),全面评估了GPT-4V结合图像回答问题的能力。我们的数据集涵盖了全面的医疗询问,包括十六种不同类型的问题。在整个评估过程中,我们为GPT-4V设计了文本提示,引导其协同视觉与文本信息。以准确率评分进行的实验得出结论:当前版本的GPT-4V不推荐用于真实世界诊断,因其在回答诊断性医疗问题时准确率低且不稳定。此外,我们勾勒出GPT-4V在医疗VQA中行为的七个独特方面,凸显其在该复杂领域中的局限。我们评估案例的完整细节可访问 https://github.com/ZhilingYan/GPT4V-Medical-Report。

关键词

引用

@article{arxiv.2310.19061,
  title  = {Multimodal ChatGPT for Medical Applications: an Experimental Study of GPT-4V},
  author = {Zhiling Yan and Kai Zhang and Rong Zhou and Lifang He and Xiang Li and Lichao Sun},
  journal= {arXiv preprint arXiv:2310.19061},
  year   = {2023}
}