中文

超越端到端视频模型:基于LLM的教育视频生成多智能体系统

人工智能 2026-02-13 v1 计算与语言

摘要

虽然最近的端到端视频生成模型在视觉导向内容创建方面表现突出,但在需要严格逻辑严谨性和精确知识表征的场景(如教学和教育媒体)仍受限。为此,我们提出LAVES——一个层次化LLM驱动的多智能体系统,用于从教育问题生成高质量教学视频。LAVES将教育视频生成建模为多目标任务,同时要求正确的逐步推理、教育上连贯的叙述、语义忠实的视觉演示以及精确的音视频对齐。为克服现有方法的局限性——包括低的程序保真度、高的生产成本和有限的可控性——LAVES将生成工作流程分解为由中心编排智能体协调的专用智能体,明确的质量门槛和迭代批评机制。具体而言,编排智能体监督负责严谨问题解决的Solution智能体、产生可执行可视化代码的Illustration智能体,以及面向学习者的教学脚本Narration智能体。此外,所有来自工作智能体的输出都受到语义批评、基于规则的约束和工具性编译检查的约束。LAVES不直接合成像素,而是构建结构化的可执行视频脚本,通过模板驱动的装配规则确定性地编译为同步的视觉和叙述,实现无需人工编辑的全自动生产。 在大规模部署中,LAVES实现了日均超过100万个视频的吞吐量,相较于当前行业标准方法实现了超过95%的成本降低,同时保持高接受率。

关键词

引用

@article{arxiv.2602.11790,
  title  = {Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation},
  author = {Lingyong Yan and Jiulong Wu and Dong Xie and Weixian Shi and Deguo Xia and Jizhou Huang},
  journal= {arXiv preprint arXiv:2602.11790},
  year   = {2026}
}

备注

For more information, visit the project website: https://robitsg.github.io/LASEV/