DreamRunner:基于检索增强运动自适应的细粒度构图叙事到视频生成
计算机视觉与模式识别
2025-11-17 v4 人工智能
计算与语言
摘要
叙事视频生成(SVG)旨在生成符合结构化叙事的连贯且视觉丰富的多场景视频。现有方法主要利用大语言模型(LLM)进行高层次规划,将叙事分解为场景级描述,再独立生成并拼接。然而,这些方法在生成与复杂单场景描述高度一致的高质量视频方面存在挑战,因为可视化此类复杂描述涉及到多个角色和事件的连贯构图、复杂运动合成以及多角色定制。为解决这些挑战,我们提出了 DREAMRUNNER,一种新的叙事到视频生成方法:首先,我们使用大语言模型(LLM)结构化输入剧本,以实现粗粒度的场景规划以及细粒度的对象级布局规划。接着,DREAMRUNNER 提供检索增强的测试时自适应,捕获每个场景中对象的目标运动先验,支持基于检索视频的多样化运动定制,从而促进生成具有复杂脚本运动的新视频。最后,我们提出一种基于空间时间区域的 3D 注意力和先验注入模块 SR3AI,用于细粒度的对象-运动绑定和逐帧空间时间语义控制。我们将 DREAMRUNNER 与各种 SVG 基线方法进行比较,证明其在角色一致性、文本对齐和平滑过渡方面实现了最新性能。此外,DREAMRUNNER 在构图文本到视频生成中展现出强大的细粒度条件跟随能力,在 T2V-ComBench 上显著优于基线方法。最后,我们通过定性示例验证了 DREAMRUNNER 在生成多对象交互方面的稳健能力。
引用
@article{arxiv.2411.16657,
title = {DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation},
author = {Zun Wang and Jialu Li and Han Lin and Jaehong Yoon and Mohit Bansal},
journal= {arXiv preprint arXiv:2411.16657},
year = {2025}
}
备注
AAAI 2026, Project website: https://zunwang1.github.io/DreamRunner