教育中的视觉问答:GPT-4V 作为多模态 AI
物理教育
2024-05-14 v1 人工智能
摘要
教育学者们分析了来自教学和学习情境中获取的各种图像数据,例如显示课堂动态的照片、关于学习内容的学生绘图以及教科书插图等。毫无疑问,大多数关于图像数据的定性分析和解释都是由人类研究者进行的,而没有采用基于机器的自动化方法。这部分原因在于大多数图像处理人工智能模型要么不易供给普通教育学者使用,要么由于其复杂的深度神经网络架构而难以解释。然而,近期发展的视觉问答 (VQA) 技术正在实现可用性强的视觉语言模型,该模型接收用户关于给定图像的问题并返回自然语言答案。特别是由 OpenAI 发布的 GPT-4V,已大幅打开了视觉语言模型的前沿服务,从而使 VQA 可用于各种目的。然而,VQA 和 GPT-4V 在教育研究中的应用仍有限。本论文提出,GPT-4V 贡献于实现教育领域的 VQA。通过“实现” VQA,我们指的是两个含义:(1) GPT-4V 实现了任何教育学者无需技术/可访问障碍即可使用 VQA 技术,(2) GPT-4V 使教育学者意识到 VQA 在教育研究中的有用性。鉴于此,本文旨在为教育研究方法提供 VQA,以此作为教育研究方法的里程碑。本文的第二章回顾了 VQA 技术的发展,这与 GPT-4V 的发布密切相关。第三章回顾了教育研究中图像分析的用法。第四章演示了 GPT-4V 如何用于第三章中每个研究用例,提供了操作提示。最后,第五章讨论了未来影响。
引用
@article{arxiv.2405.07163,
title = {Realizing Visual Question Answering for Education: GPT-4V as a Multimodal AI},
author = {Gyeong-Geon Lee and Xiaoming Zhai},
journal= {arXiv preprint arXiv:2405.07163},
year = {2024}
}