基于 LLM 的 Manim 动画生成的训练与智能推理策略
人工智能
2026-04-21 v1 图形学
多智能体系统
摘要
使用诸如 Manim 之类的库生成程序化动画对大型语言模型(LLM)提出了独特挑战,要求进行空间推理、时序组织以及熟悉领域特定 API,这些 API 在通用预训练数据中缺乏覆盖。目前研究缺乏对训练与推理策略在此设置下如何相互作用的系统性研究。本研究引入 ManimTrainer,一个结合了监督微调(SFT)与基于群相对政策优化(GRPO)的强化学习(RL)训练管道的统一奖励信号框架,融合代码与视觉评估信号;以及 ManimAgent,一种具有渲染内置(Renderer-in-the-loop, RITL)和 API 文档增强型 RITL(RITL-DOC)策略的推理管道。使用这些技术,本研究提出了面向 Manim 文本到代码到视频转换的首个统一训练与推理研究。我们使用 ManimBench 对 17 个开源亚 30B 参数规模的 LLM,评估九种训练与推理策略的组合。结果表明,SFT generally 提升代码质量,而 GRPO 改善视觉输出并增强模型在推理期间对外部信号的响应。搭载 GRPO 与 RITL-DOC 的 Qwen 3 Coder 30B 模型取得最佳整体绩效,渲染成功率(Render Success Rate, RSR)达 94%,视觉相似度(Visual Similarity, VS)达 85.7%,超越基线 GPT-4.1 模型在 VS 上提升 3 个百分点。此外,分析显示,代码与视觉指标之间的相关性在 SFT 与 GRPO 下加强,但在推理时增强下减弱,凸显了训练与智能推理策略在 Manim 动画生成中的互补作用。
引用
@article{arxiv.2604.18364,
title = {Training and Agentic Inference Strategies for LLM-based Manim Animation Generation},
author = {Ravidu Suien Rammuni Silva and Ahmad Lotfi and Isibor Kennedy Ihianle and Golnaz Shahtahmassebi and Jordan J. Bird},
journal= {arXiv preprint arXiv:2604.18364},
year = {2026}
}