Google Bard 与 GPT-Vision 的多模态分析:视觉推理实验
计算机视觉与模式识别
2023-10-18 v2 计算与语言
机器学习
摘要
针对大语言模型(LLMs)视觉理解研究中的空白,我们设计了一项挑战-响应研究,对 Google Bard 和 GPT-Vision 施加了 64 项视觉任务,涵盖“视觉情境推理”和“下一场景预测”等类别。此前的模型(如 GPT4)严重依赖 Tesseract 等光学字符识别工具,而 Bard 和 GPT-Vision 类似于 Google Lens 和 Visual API,采用深度学习技术进行视觉文本识别。然而,我们的研究结果凸显了这两个视觉-语言模型的局限性:虽然它们善于解决令 ChatGPT 单独应对时束手无策的视觉 CAPTCHA,但在重建 ASCII 艺术等视觉元素或分析井字棋网格时表现不佳,表明其过度依赖基于经验的视觉猜测。基于视觉输入的预测问题显得尤其具有挑战性,当前基于“下一词元”的多模态模型无法进行下一场景预测的常见 sense 猜测。本研究为多模态 LLM 的当前能力与待改进之处提供了实验性见解。
引用
@article{arxiv.2309.16705,
title = {Multimodal Analysis Of Google Bard And GPT-Vision: Experiments In Visual Reasoning},
author = {David Noever and Samantha Elizabeth Miller Noever},
journal= {arXiv preprint arXiv:2309.16705},
year = {2023}
}