Benchmarking Generative Models on Computational Thinking Tests in Elementary Visual Programming
人工智能
2025-03-19 v2
摘要
生成模型在编程、自然科学和通用知识等多个领域的各种基准测试中已展现出接近人类水平的能力。尽管这些在竞争性基准测试中取得的令人鼓舞的结果,但在看似简单的问题解决任务上仍难以胜任,这些任务通常由小学水平的学生完成。最先进的模型在设计用于评估学校中计算思维和问题解决技能的标准化编程相关测试时表现如何?本文中我们构建了一个以小学视觉编程领域为基础的计算思维测试新基准。我们的初始结果显示,最先进的模型如 GPT-4o 和 Llama3 仅能匹配平均学校学生的表现。为进一步提升这些模型的性能,我们采用一种新颖的合成数据生成方法进行微调。其核心思想是开发一个全面的数据集,捕捉从视觉元素识别到多选题到合成式任务的不同技能水平。我们展示了符号信息在合成数据中各种方面如何帮助提高微调后模型的性能。我们将发布完整的实现和数据集,以促进进一步的研究以增强生成模型的计算思维。
引用
@article{arxiv.2406.09891,
title = {Benchmarking Generative Models on Computational Thinking Tests in Elementary Visual Programming},
author = {Victor-Alexandru Pădurean and Adish Singla},
journal= {arXiv preprint arXiv:2406.09891},
year = {2025}
}