评估 GPT4-V 在结构化推理任务上的表现
计算与语言
2023-12-20 v1 人工智能
计算机视觉与模式识别
摘要
多模态技术有望为大型语言模型解锁更多用途。最近,最先进的语言模型 GPT-4 增强了视觉能力。我们在结构化推理任务(如数学推理、视觉数据分析和代码生成)上,对 GPT-4V 及其他五个基线模型进行了提示评估。我们表明,视觉思维链(Visual Chain-of-Thought)作为思维链在多模态大型语言模型中的扩展,相较于原始模型产生了显著改进。我们还呈现了对这些模型表现良好和表现困难场景的分类分析,突出了与连贯多模态推理相关的挑战。
引用
@article{arxiv.2312.11524,
title = {Assessing GPT4-V on Structured Reasoning Tasks},
author = {Mukul Singh and José Cambronero and Sumit Gulwani and Vu Le and Gust Verbruggen},
journal= {arXiv preprint arXiv:2312.11524},
year = {2023}
}
备注
9 pages, 9 figures