先见后码:学习视觉先验以生成空间感知的教育动画
人工智能
2026-05-18 v1 计算机视觉与模式识别
摘要
大型语言模型可以为教育动画生成可执行代码,但生成的渲染结果常常出现视觉缺陷,包括元素重叠、错位和动画连续性中断。这些缺陷无法仅从代码中可靠地检测出来,只有在执行后才会显现。我们将此问题形式化为渲染反馈感知的约束代码生成:给定一个自然语言规范,模型必须生成可执行代码,其渲染输出满足只能在渲染后评估的结构化质量标准。为了解决这个问题,我们引入了OmniManim,一个围绕共享场景状态、显式视觉规划、结构化渲染后诊断和局部修复构建的渲染反馈感知的教育动画生成框架。在OmniManim中,视觉代理是一个任务特定的视觉规划模块:它通过从粗到细的边界框去噪预测稀疏关键帧布局,并优化一个插值感知的目标,以减少由下游动画插值引起的中间帧失败。我们进一步构建了两个数据集,ManimLayout-1K和EduRequire-500,并提供了一个涵盖可执行性、教学质量、视觉质量和效率的可复现评估协议。在EduRequire-500上,OmniManim在测量的渲染质量上优于单模型基线和现有的多智能体框架。系统的消融研究进一步验证了显式视觉规划,尤其是其粗略空间先验、边界框细化和插值感知优化,是这些增益的核心。
引用
@article{arxiv.2605.15585,
title = {See Before You Code: Learning Visual Priors for Spatially Aware Educational Animation Generation},
author = {Yuejia Li and Ke He and Junheng Li and Shutong Chen and Jingkang Xia and Zhiyue Su and Junchi Zhang and Mang Ye},
journal= {arXiv preprint arXiv:2605.15585},
year = {2026}
}
备注
21 pages, 4 figures