Gemini 与 GPT-4V:通过定性案例对视觉-语言模型进行初步比较与组合
计算机视觉与模式识别
2023-12-27 v1
摘要
快速发展的多模态大语言模型(MLLM)领域处于人工智能中语言与视觉处理整合的前沿。本文对两个先驱模型:Google 的 Gemini 和 OpenAI 的 GPT-4V(ision) 进行了深入的对比研究。我们的研究涉及对两个模型在视觉-语言能力、人机交互、时间理解以及智商和情商评估等关键维度上的多方面评估。我们分析的核心深入探讨了每个模型独特的视觉理解能力。我们进行了一系列结构化实验,以评估它们在各种工业应用场景中的表现,提供了关于其实用性的全面视角。我们不仅进行了直接的表现比较,还对提示和场景进行了调整,以确保平衡和公平的分析。我们的发现阐明了两个模型独特的优势和适用领域。GPT-4V 以其响应的精确性和简洁性脱颖而出,而 Gemini 则擅长提供附带相关图像和链接的详细、广泛的答案。这些理解不仅揭示了 Gemini 和 GPT-4V 的相对优势,还突显了多模态基础模型不断发展的格局,为该领域的未来进展铺平了道路。在进行比较之后,我们尝试通过结合这两个模型来获得更好的结果。最后,我们对 GPT-4V 和 Gemini 背后的团队对该领域的开创性贡献表示深切的感谢。我们还对 Yang 等人在《Dawn》中提出的全面定性分析表示感谢。这项工作以其广泛的图像样本、提示和 GPT-4V 相关结果集合,为我们的分析提供了基础。
引用
@article{arxiv.2312.15011,
title = {Gemini vs GPT-4V: A Preliminary Comparison and Combination of Vision-Language Models Through Qualitative Cases},
author = {Zhangyang Qi and Ye Fang and Mengchen Zhang and Zeyi Sun and Tong Wu and Ziwei Liu and Dahua Lin and Jiaqi Wang and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2312.15011},
year = {2023}
}
备注
Project Page: https://github.com/Qi-Zhangyang/Gemini-vs-GPT4V. arXiv admin note: substantial text overlap with arXiv:2309.17421