评估 ChatGPT-4 Vision 在巴西国家本科计算机科学考试中的表现
人工智能
2024-06-17 v1 计算与语言
摘要
大型语言模型 (LLM) 集成视觉能力的近期进展,可能在科学技术教育中发挥关键作用,因为其中包含有关图表、图表和表格的视觉元素,这些元素通常用于改进学习体验。本研究考察了 ChatGPT-4 Vision——当时最先进的视觉模型——在巴西 2021 年国家本科计算机科学考试 (ENADE) 中计算机科学部分的性能。通过以原始图像格式呈现该考试的开放性和选择题,并允许针对不同答案密钥进行重新评估,我们能够评估该模型在大规模学术评估中涉及文本和视觉内容的推理和自反能力。ChatGPT-4 Vision 在平均考试参与者水平上显著超越,位于前 10% 最佳得分百分位。虽然它在包含视觉元素的问题中表现出色,但也在问题解释、逻辑推理和视觉敏感性方面遇到挑战。涉及独立专家小组审查模型与答案密钥之间不一致情况的案例,揭示了一些不良设计的题目包含模糊或不明确的表述,凸显在未来考试中改进题目设计的 critical need。我们的发现表明,尽管 ChatGPT-4 Vision 在多模态学术评估中显示出前景,但人类监督仍然对于验证模型的准确性并确保高风险教育考试的公平性至关重要。本论文的研究材料可公开获取,地址为 https://github.com/nabormendonca/gpt-4v-enade-cs-2021。
引用
@article{arxiv.2406.09671,
title = {Evaluating ChatGPT-4 Vision on Brazil's National Undergraduate Computer Science Exam},
author = {Nabor C. Mendonça},
journal= {arXiv preprint arXiv:2406.09671},
year = {2024}
}
备注
Accepted for publication