惊人失效?多模态大语言模型与 NLVR 挑战
人工智能
2024-02-29 v1 计算与语言
机器学习
摘要
本研究评估了三种最先进的多模态大语言模型——GPT-4V、Gemini Pro 和开源模型 IDEFICS——在组合自然语言视觉推理任务 NLVR 上的表现。该任务要求模型根据给定的人编写的句子和合成图像,判断句子相对于图像的真值。尽管这些模型表现出色,但我们发现它们在 NLVR 上表现不佳,该任务被设计为需要组合和空间推理,并且对语义和系统偏差具有鲁棒性。
引用
@article{arxiv.2402.17793,
title = {A Surprising Failure? Multimodal LLMs and the NLVR Challenge},
author = {Anne Wu and Kianté Brantley and Yoav Artzi},
journal= {arXiv preprint arXiv:2402.17793},
year = {2024}
}