StoryBlender:具有时空动态的镜头间一致且可编辑的 3D 故事板
计算机视觉与模式识别
2026-04-07 v1 人工智能
摘要
故事板是电影、动画和游戏中视觉叙事的核心技能。然而,自动化此过程需要一个系统同时实现当前方法很少能同时满足的两个特性:镜头间一致性和显式可编辑性。虽然基于 2D 扩散的生成器能产生生动的图像,但它们常常遭受身份漂移和有限的几何控制;相反,传统的 3D 动画工作流具有一致性和可编辑性,但需要专家密集、劳动密集的创作。我们提出 StoryBlender,一个由故事中心反射方案支配的、有基础的 3D 故事板生成框架。其核心是我们提出的 StoryBlender 系统,该系统建立在一个三阶段流水线上:(1)语义-空间基础,构建一个连续性记忆图,将全局资产与镜头特定变量解耦,以实现长程一致性;(2)规范资产实体化,在统一坐标空间中实例化实体以保持视觉身份;(3)时空动态,通过视觉指标实现布局设计和电影化演变。通过在验证循环内以分层方式协调多个智能体,StoryBlender 通过引擎验证的反馈迭代地自我纠正空间幻觉。生成的本地 3D 场景支持对相机和视觉资产进行直接、精确的编辑,同时保持坚定不移的多镜头连续性。实验表明,StoryBlender 在一致性和可编辑性方面显著优于基于扩散和基于 3D 的基线。代码、数据和演示视频将在 https://engineeringai-lab.github.io/StoryBlender/ 上提供。
引用
@article{arxiv.2604.03315,
title = {StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics},
author = {Bingliang Li and Zhenhong Sun and Jiaming Bian and Yuehao Wu and Yifu Wang and Hongdong Li and Yatao Bian and Huadong Mo and Daoyi Dong},
journal= {arXiv preprint arXiv:2604.03315},
year = {2026}
}