ManiBench:测试 Manim 代码生成中的视觉-逻辑漂移与语法幻觉的基准
人工智能
2026-03-17 v1
摘要
传统基准如 HumanEval 与 MBPP 在测试逻辑与语法方面有效,但当代码必须生成动态、教育性的视觉效果时,难以发挥作用。我们引入 ManiBench,一个专门评估大型语言模型在生成 Manim CE 代码时的性能的基准,此处时间保真度和版本感知 API 正确性至关重要。ManiBench 针对两类关键失效模式进行测试:语法幻觉(有效的 Python 代码引用不存在或已废弃的 Manim API)和视觉-逻辑漂移(生成的视觉效果因时序错误或缺失因果关系而偏离预期数学逻辑)。该基准包含 150-200 个问题,覆盖五个难度级别,涵盖微积分、线性代数、概率论、拓扑学与人工智能,基于对 3Blue1Brown ManimGL 源代码(53,000 行,143 个场景类)的分析。评估采用四级框架,衡量可执行性、版本冲突错误率、对齐得分与覆盖得分。一个开源框架可自动化评估多个模型与提示策略。代码、数据与基准套件已发布于 https://github.com/nabin2004/ManiBench。数据集托管于 https://huggingface.co/datasets/nabin2004/ManiBench。
引用
@article{arxiv.2603.13251,
title = {ManiBench: A Benchmark for Testing Visual-Logic Drift and Syntactic Hallucinations in Manim Code Generation},
author = {Nabin Oli},
journal= {arXiv preprint arXiv:2603.13251},
year = {2026}
}