Paper2Video:从科学论文自动生成视频
计算机视觉与模式识别
2025-10-10 v2 人工智能
计算与语言
多智能体系统
多媒体
摘要
学术演示视频已成为研究沟通的 essential 媒介,但制作仍高度依赖人力,往往需要数小时的制作、录制和编辑才能制作出 2 到 10 分钟的视频。与自然视频不同,演示视频生成面临独特挑战:来自科学论文的输入、密集的多模态信息(文本、图表、表格),以及需要协调多个对齐通道(幻灯片、字幕、语音、人类解说)。为此,我们引入 Paper2Video,首个包含 101 篇科学论文配合作者创建的演示视频、幻灯片和说话人元数据的基准数据集。我们进一步设计了四个量身定制的评估指标——Meta Similarity、PresentArena、PresentQuiz 和 IP Memory——来衡量视频如何向观众传达论文信息。基于此基础,我们提出 PaperTalker,首个用于学术演示视频生成的多智能体框架。它集成了幻灯片生成与有效布局细化(通过 novel effective tree search visual choice 实现),光标定位、字幕、语音合成和 talking-head 渲染,同时对幻灯片级生成进行并行化以提高效率。Paper2Video 上的实验表明,我们的方法生成的演示视频在忠实性和信息传递方面优于现有基线,为自动化和即用型学术视频生成迈出了实用步伐。我们的数据集、智能体和代码已在 https://github.com/showlab/Paper2Video 上提供。
关键词
引用
@article{arxiv.2510.05096,
title = {Paper2Video: Automatic Video Generation from Scientific Papers},
author = {Zeyu Zhu and Kevin Qinghong Lin and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2510.05096},
year = {2025}
}
备注
Project Page: https://showlab.github.io/Paper2Video/