中文

GPT4Vis:GPT-4 能为零样本视觉识别做什么?

计算机视觉与模式识别 2024-03-13 v2

摘要

本文未提出新方法。相反,鉴于生成式人工智能(GenAI)的最新进展,它深入探究了一个必要但必须了解的基线:利用 GPT-4 进行视觉理解。我们的研究聚焦于评估 GPT-4 在零样本视觉识别任务中的语言与视觉能力:首先,我们探索其生成的跨各类别的丰富文本描述在无需任何训练的情况下提升识别性能的潜力。其次,我们评估 GPT-4 直接识别多样视觉内容的视觉能力。我们开展了大量实验,在图像、视频与点云上系统评估 GPT-4 的性能,使用 16 个基准数据集测量 top-1 与 top-5 准确率。我们的发现表明,借助丰富语言描述增强的 GPT-4 显著改善了零样本识别,在所有数据集上平均 top-1 准确率提升 7%。GPT-4 在视觉识别中表现出色,超越 OpenAI-CLIP 的 ViT-L 并与 EVA-CLIP 的 ViT-E 相匹敌,尤其在视频数据集 HMDB-51 与 UCF-101 中分别领先 22% 与 9%。我们希望本研究为未来工作提供有价值的数据点与经验。我们在 https://github.com/whwu95/GPT4Vis 发布代码。

关键词

引用

@article{arxiv.2311.15732,
  title  = {GPT4Vis: What Can GPT-4 Do for Zero-shot Visual Recognition?},
  author = {Wenhao Wu and Huanjin Yao and Mengxi Zhang and Yuxin Song and Wanli Ouyang and Jingdong Wang},
  journal= {arXiv preprint arXiv:2311.15732},
  year   = {2024}
}

备注

Technical report. Retest GPT-4V and update results