评估 GPT-4 在巴西大学入学考试中的视觉能力
计算与语言
2023-11-27 v1 人工智能
机器学习
摘要
语言模型的最新进展已展示出在学术入学考试中可与人类媲美的表现。然而,现有研究常忽略需要视觉理解整合的问题,从而损害了真实场景所固有的完整频谱与复杂性。为弥补这一缺口,我们提出一个综合框架,在入学考试中评估语言模型,其融合了文本与视觉元素。我们评估了 Exame Nacional do Ensino Médio(ENEM,巴西大学采用的主要标准化入学考试)最近两届试题。我们的研究不仅重申了 GPT-4 作为处理复杂多学科问题的 SOTA(最先进)模型的能力,也开创了针对葡萄牙语考试中多模态语言模型的现实评估。亮点之一是转写视觉内容的文本描述优于图像的直接使用,表明视觉模型仍有改进空间。然而,尽管图像或描述带来了改进,数学问题对这些 SOTA 模型而言仍是挑战。实验所用代码与数据见 https://github.com/piresramon/gpt-4-enem。
引用
@article{arxiv.2311.14169,
title = {Evaluating GPT-4's Vision Capabilities on Brazilian University Admission Exams},
author = {Ramon Pires and Thales Sales Almeida and Hugo Abonizio and Rodrigo Nogueira},
journal= {arXiv preprint arXiv:2311.14169},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2303.17003