中文

PresentAgent-2:通用多模态演示代理

计算机视觉与模式识别 2026-05-13 v1 计算与语言

摘要

演示生成正在超越静态幻灯片创建,朝着以研究 grounding、多模态媒体和交互式交付为特征的端到端演示视频生成发展。我们引入PresentAgent-2,这是一个从用户查询生成演示视频的 agentic 框架。给定开放式用户查询和选定的演示模式,PresentAgent-2首先将查询概括为聚焦主题,随后对演示友好来源进行深入研究以收集多模态资源,包括相关文本、图像、GIF和视频。它然后构建演示幻灯片、生成模式特定的脚本,并将幻灯片、音频和动态媒体合成为完整的演示视频。PresentAgent-2支持三种独立的演示模式于统一框架内:Single Presentation(单一演示)生成单个讲者讲述的演示视频;Discussion(讨论)创建具有结构化讲者角色的多讲者演示,如提问引导、解释概念、澄清细节和总结要点;Interaction(交互)独立支持基于生成的幻灯片、脚本、检索证据和演示上下文回答观众问题。为评估这些能力,我们构建了一个覆盖单一演示、讨论和交互场景的多模态演示基准,包含内容质量、媒体相关性、动态媒体使用、对话自然性和交互 grounding 等任务特定评估标准。总体而言,PresentAgent-2将演示生成从依赖文档的幻灯片创建扩展到查询驱动、以研究为基础的多模态演示视频生成,涵盖多模态媒体、对话和交互。代码:https://github.com/AIGeeksGroup/PresentAgent-2。网站:https://aigeeksgroup.github.io/PresentAgent-2。

关键词

引用

@article{arxiv.2605.11363,
  title  = {PresentAgent-2: Towards Generalist Multimodal Presentation Agents},
  author = {Wei Wu and Ziyang Xu and Zeyu Zhang and Yang Zhao and Hao Tang},
  journal= {arXiv preprint arXiv:2605.11363},
  year   = {2026}
}