中文

GPT-4V 的挑战者?Gemini 在视觉专长能力上的早期探索

计算机视觉与模式识别 2023-12-21 v2 人工智能 计算与语言 多媒体

摘要

对多模态大语言模型(MLLMs)的激增兴趣,例如 OpenAI 的 GPT-4V(ision),已成为学术界和工业界的显著趋势。它们赋予大语言模型(LLMs)强大的视觉理解能力,使其能够处理多样化的多模态任务。最近,Google 发布了 Gemini,这是其从头构建用于多模态的最新且最强大的 MLLM。鉴于其卓越的推理能力,Gemini 能否挑战 GPT-4V 在多模态学习中的领先地位?在本文中,我们对 Gemini Pro 的视觉理解能力进行了初步探索,全面涵盖四个领域:基础感知、高级认知、具有挑战性的视觉任务以及各种专家能力。我们将 Gemini Pro 与最先进的 GPT-4V 进行比较以评估其上限,同时比较了最新的开源 MLLM Sphinx,揭示了人工努力与黑盒系统之间的差距。定性样本表明,虽然 GPT-4V 和 Gemini 展示了不同的回答风格和偏好,但它们表现出相当的视觉推理能力,而 Sphinx 在领域泛化性方面仍落后于它们。具体而言,GPT-4V 倾向于阐述详细的解释和中间步骤,而 Gemini 偏好输出直接且简洁的答案。在流行的 MME 基准上的定量评估也证明了 Gemini 成为 GPT-4V 强有力挑战者的潜力。我们对 Gemini 的早期调查也观察到了 MLLMs 的一些常见问题,表明距离通用人工智能仍有相当的距离。我们用于跟踪 MLLM 进展的项目发布于 https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models。

关键词

引用

@article{arxiv.2312.12436,
  title  = {A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise},
  author = {Chaoyou Fu and Renrui Zhang and Zihan Wang and Yubo Huang and Zhengye Zhang and Longtian Qiu and Gaoxiang Ye and Yunhang Shen and Mengdan Zhang and Peixian Chen and Sirui Zhao and Shaohui Lin and Deqiang Jiang and Di Yin and Peng Gao and Ke Li and Hongsheng Li and Xing Sun},
  journal= {arXiv preprint arXiv:2312.12436},
  year   = {2023}
}

备注

Total 120 pages. See our project at https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models