中文

Preacher:论文转视频智能体系统

计算机视觉与模式识别 2025-09-09 v6 人工智能

摘要

论文转视频任务将一篇研究论文转换为结构化的视频摘要,提炼关键概念、方法和结论,形成易于理解、组织良好的格式。尽管最先进的视频生成模型展现出潜力,但它们受到有限的上下文窗口、严格的视频时长限制、有限的风格多样性以及无法表示领域特定知识的制约。为解决这些局限性,我们引入了 Preacher,首个论文转视频智能体系统。Preacher 采用自上而下的方法对论文进行分解、总结和重构,随后进行自下而上的视频生成,将多样化的视频片段合成为一个连贯的摘要。为对齐跨模态表示,我们定义了关键场景,并引入了一种渐进式思维链(P-CoT)用于细粒度、迭代式的规划。Preacher 成功地在五个研究领域生成了高质量的视频摘要,展现了超越当前视频生成模型的专业能力。代码将发布于:https://github.com/Gen-Verse/Paper2Video

关键词

引用

@article{arxiv.2508.09632,
  title  = {Preacher: Paper-to-Video Agentic System},
  author = {Jingwei Liu and Ling Yang and Hao Luo and Fan Wang and Hongyan Li and Mengdi Wang},
  journal= {arXiv preprint arXiv:2508.09632},
  year   = {2025}
}

备注

ICCV 2025. Code: https://github.com/Gen-Verse/Paper2Video