TurtleBench:基于海龟几何的可视化编程基准
人工智能
2025-04-15 v2 计算机视觉与模式识别
摘要
人类自幼即可推理图像和场景中的几何图案。然而,发展具备类似能力的大型多模态模型(LMM)仍然是一个挑战,这凸显了需要鲁棒评估方法来评估这些能力的重要性。我们提出了Turtle,一个旨在评估LMM解释几何图案能力的基准——给定视觉示例、文本指令或两者兼具,并生成精确代码输出。灵感来自海龟几何,这是一种用于教授儿童基础编码和几何概念的概念。TurtleBench包含具有底层算法逻辑的图案图形任务。我们的评估表明,领先的LMM在这些任务上表现严重不足,GPT-4o在最简单的任务上仅达到19%的准确率,少量样本提示几乎只略微提高了它们的性能(<2%)。Turtle凸显了人类与AI在直观和视觉几何理解能力之间的差距,为该领域的未来研究奠定了基础。Turtle是少数几个评估LMM视觉理解与代码生成能力集成基准之一,为该领域的未来研究奠定了基础。本论文的代码和数据集提供于\href{https://github.com/sinaris76/TurtleBench}{https://github.com/sinaris76/TurtleBench}。
引用
@article{arxiv.2411.00264,
title = {TurtleBench: A Visual Programming Benchmark in Turtle Geometry},
author = {Sina Rismanchian and Yasaman Razeghi and Sameer Singh and Shayan Doroudi},
journal= {arXiv preprint arXiv:2411.00264},
year = {2025}
}