中文

XLogoOnline环境中视觉编程的程序合成基准

人工智能 2025-10-07 v2

摘要

大型语言和多模态模型在针对特定技能(如通用编程、数学应用题求解和视觉问答)的各种基准测试上取得了显著成功。然而,尚不清楚这些模型在需要结合这些技能的任务上表现如何。在本文中,我们基于XLogoOnline视觉编程环境中的真实世界任务,整理了一个新颖的程序合成基准。每个任务都需要结合不同的技能,如空间规划、基础编程和逻辑推理。我们的评估表明,当前最先进的模型如GPT-4V和Llama3-70B在解决这些任务时表现挣扎,成功率分别仅为20%和2.35%。接下来,我们开发了一个微调流程,通过利用包含超过80,000个任务的大规模合成训练数据集来提升模型性能。此外,我们展示了如何使用模拟器驱动的反馈来设计训练数据分布上的课程,通过该课程,微调后的Llama3-8B模型性能大幅优于GPT-4V和Llama3-70B模型。最后,我们提供了深入的失败分析,以理解不同模型的局限性。我们将公开发布该基准,以促进视觉编程中程序合成的未来研究。

关键词

引用

@article{arxiv.2406.11334,
  title  = {Program Synthesis Benchmark for Visual Programming in XLogoOnline Environment},
  author = {Chao Wen and Jacqueline Staub and Adish Singla},
  journal= {arXiv preprint arXiv:2406.11334},
  year   = {2025}
}

备注

ACL'25 paper