VAST 1.0:面向可控且一致视频生成的统一框架
计算机视觉与模式识别
2024-12-24 v1
摘要
从文本描述生成高质量视频面临在保持时间一致性和控制主体运动方面的挑战。我们提出 VAST (Video As Storyboard from Text),一个两个阶段的框架以解决这些挑战并实现高质量视频生成。在第一个阶段,StoryForge 将文本描述转换为详细的分镜,捕捉人体姿态和物体布局,以表示场景的结构本质。在第二个阶段,VisionForge 从这些分镜生成视频,产生具有平滑运动、时间一致性和空间一致性的高质量视频。通过将文本理解与视频生成解耦,VAST 实现了对主体动态和场景构图的精确控制。在 VBench 框架上的实验表明,VAST 在视觉质量和语义表达方面均优于现有方法,为动态且连贯的视频生成树立了新标准。
引用
@article{arxiv.2412.16677,
title = {VAST 1.0: A Unified Framework for Controllable and Consistent Video Generation},
author = {Chi Zhang and Yuanzhi Liang and Xi Qiu and Fangqiu Yi and Xuelong Li},
journal= {arXiv preprint arXiv:2412.16677},
year = {2024}
}