GPT-4V 与 Gemini 在在线视觉问答中的评估
计算机视觉与模式识别
2024-02-15 v2 人工智能
摘要
尽管人们对大型多模态模型(LMM)的潜力充满期待,但全面的评估对于确立其真实能力与局限性至关重要。为了支持这一目标,我们在一个源自真实在线问答社区的全新视觉问答数据集上,评估了两个最先进的 LMM:GPT-4V 和 Gemini。我们通过为近 2000 个视觉问题生成七种类型的元数据(如图像类型和所需的图像处理能力)来进行细粒度分析。我们的零样本性能分析突出了对两个模型最具挑战性的问题类型,包括与“解谜”主题相关、具有“识别”用户意图、具有“乐谱”图像类型或被 GPT-4 标记为“困难”的问题。
引用
@article{arxiv.2312.10637,
title = {An Evaluation of GPT-4V and Gemini in Online VQA},
author = {Mengchen Liu and Chongyan Chen and Danna Gurari},
journal= {arXiv preprint arXiv:2312.10637},
year = {2024}
}
备注
20 pages