中文

对 GPT-4V(ision) 的早期评估

计算与语言 2023-10-26 v1 计算机视觉与模式识别

摘要

在本文中,我们评估了 GPT-4V 的不同能力,包括视觉理解、语言理解、视觉谜题求解,以及对深度、热成像、视频和音频等其他模态的理解。为估计 GPT-4V 的性能,我们手动构建了 656 个测试实例并仔细评估了 GPT-4V 的结果。我们发现的重点如下:(1)GPT-4V 在英语视觉中心基准上表现出令人印象深刻的性能,但无法识别图像中的简单中文文本;(2)GPT-4V 在回答与性别、种族和年龄等敏感特质相关的问题时表现出不一致的拒绝行为;(3)GPT-4V 在包括通用语言理解基准和视觉常识知识评估基准在内的语言理解任务上获得比 GPT-4(API)更差的结果;(4)少样本提示(few-shot prompting)可改善 GPT-4V 在视觉理解和语言理解上的性能;(5)GPT-4V 难以发现两幅相似图像间的细微差别并求解简单的数学图片谜题;(6)GPT-4V 在视频和热成像等与图像模态相似的任务上展现出非平凡的性能。我们的实验结果揭示了 GPT-4V 的能力与局限,希望本文能为 GPT-4V 的应用与研究提供一些见解。

关键词

引用

@article{arxiv.2310.16534,
  title  = {An Early Evaluation of GPT-4V(ision)},
  author = {Yang Wu and Shilong Wang and Hao Yang and Tian Zheng and Hongbo Zhang and Yanyan Zhao and Bing Qin},
  journal= {arXiv preprint arXiv:2310.16534},
  year   = {2023}
}

备注

Technical Report. Data are available at https://github.com/albertwy/GPT-4V-Evaluation