一只眼给 AI:评估 GPT-4o 的视觉感知能力与几何推理能力——基于计算机图形学问题
人工智能
2024-10-23 v1 图形学
摘要
计算机图形学(CG)是计算机科学(CS)中的热门领域,但许多学生发现该领域困难,因为其需要数学、编程、几何推理和创造力等多项技能。过去几年,研究人员一直在探索如何利用生成式人工智能(GenAI)的强大能力来改进教学。在 CS 领域,这些研究主要集中在入门计算课程上。最近的一项研究评估了仅基于文本的大语言模型(LLM)GPT-4 在 CG 题目上的表现,表明其表现不佳,依赖于对图像内容的详细描述,这些描述往往需要用户提供 considerable insight 才能返回合理结果。迄今为止,尚无研究探究多模态模型(LMM)或多模态 LLM 在解决 CG 题目方面的能力,以及这些能力如何用于改进教学。本研究构建了两个 CG 题目数据集,涵盖不同程度的视觉感知技能和几何推理技能,并对当前最先进的 LMM——GPT-4o 在这两个数据集上的表现进行评估。我们发现尽管 GPT-4o 在独立处理带有视觉信息的问题方面展现出巨大的潜力,但在准确性和生成结果质量方面仍存在重大局限。我们提出了若干新方法,帮助 CG 教育者在这些局限性仍然存在的情况下将 GenAI 融入 CG 教学。我们希望我们的指南能够进一步鼓励在 CG 课堂中学习和参与。
引用
@article{arxiv.2410.16991,
title = {An Eye for an AI: Evaluating GPT-4o's Visual Perception Skills and Geometric Reasoning Skills Using Computer Graphics Questions},
author = {Tony Haoran Feng and Paul Denny and Burkhard C. Wünsche and Andrew Luxton-Reilly and Jacqueline Whalley},
journal= {arXiv preprint arXiv:2410.16991},
year = {2024}
}
备注
8 pages, 8 figures, 1 table, to be published in SIGGRAPH Asia 2024 Educator's Forum