中文

惊人失效?多模态大语言模型与 NLVR 挑战

人工智能 2024-02-29 v1 计算与语言 机器学习

摘要

本研究评估了三种最先进的多模态大语言模型——GPT-4V、Gemini Pro 和开源模型 IDEFICS——在组合自然语言视觉推理任务 NLVR 上的表现。该任务要求模型根据给定的人编写的句子和合成图像,判断句子相对于图像的真值。尽管这些模型表现出色,但我们发现它们在 NLVR 上表现不佳,该任务被设计为需要组合和空间推理,并且对语义和系统偏差具有鲁棒性。

关键词

引用

@article{arxiv.2402.17793,
  title  = {A Surprising Failure? Multimodal LLMs and the NLVR Challenge},
  author = {Anne Wu and Kianté Brantley and Yoav Artzi},
  journal= {arXiv preprint arXiv:2402.17793},
  year   = {2024}
}