更多机器人来袭:大型多模态模型(ChatGPT)可求解视觉多样化的 Parsons 问题图像
计算与语言
2023-11-10 v1 人工智能
摘要
大型语言模型的出现正在重塑计算机教育。近期研究表明,这些模型能够生成比学生更好的解释,在选择题上的作答达到或高于班级平均水平,并能在入门课程中生成可通过自动化测试的代码。这些能力促使教师迅速调整其课程与评估方法,以适应学习目标的变化以及学术不端行为的可能性。尽管一些学者主张引入视觉问题作为抵御语言模型能力的手段,但新型多模态语言模型现已具备视觉与语言能力,可能使其得以分析并求解视觉问题。在本文中,我们评估了两个大型多模态模型在视觉作业上的表现,特别关注以多样化视觉表征呈现的 Parsons 问题。我们的结果显示,GPT-4V 求解了 96.7% 的此类视觉问题,仅对单个 Parsons 问题略有困难。相反,Bard 表现不佳,仅求解了 69.2% 的问题,并受困于幻觉与拒答等常见问题。这些发现表明,仅仅转向视觉编程问题可能并非生成式 AI 时代中学术不端问题的万灵药。
引用
@article{arxiv.2311.04926,
title = {More Robots are Coming: Large Multimodal Models (ChatGPT) can Solve Visually Diverse Images of Parsons Problems},
author = {Irene Hou and Owen Man and Sophie Mettille and Sebastian Gutierrez and Kenneth Angelikas and Stephen MacNeil},
journal= {arXiv preprint arXiv:2311.04926},
year = {2023}
}