面向医疗应用的多模态ChatGPT:GPT-4V的实验研究
计算机视觉与模式识别
2023-10-31 v1
摘要
在本文中,我们批判性评估了最先进的多模态大语言模型,即带视觉功能的GPT-4(GPT-4V),在视觉问答(VQA)任务上的能力。我们的实验利用来自11种模态(如显微镜、皮肤镜、X射线、CT等)的病理学与放射学数据集以及15个感兴趣对象(脑、肝、肺等),全面评估了GPT-4V结合图像回答问题的能力。我们的数据集涵盖了全面的医疗询问,包括十六种不同类型的问题。在整个评估过程中,我们为GPT-4V设计了文本提示,引导其协同视觉与文本信息。以准确率评分进行的实验得出结论:当前版本的GPT-4V不推荐用于真实世界诊断,因其在回答诊断性医疗问题时准确率低且不稳定。此外,我们勾勒出GPT-4V在医疗VQA中行为的七个独特方面,凸显其在该复杂领域中的局限。我们评估案例的完整细节可访问 https://github.com/ZhilingYan/GPT4V-Medical-Report。
引用
@article{arxiv.2310.19061,
title = {Multimodal ChatGPT for Medical Applications: an Experimental Study of GPT-4V},
author = {Zhiling Yan and Kai Zhang and Rong Zhou and Lifang He and Xiang Li and Lichao Sun},
journal= {arXiv preprint arXiv:2310.19061},
year = {2023}
}