中文

VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention

计算机视觉与模式识别 2025-10-03 v3 人工智能

摘要

当前视频生成模型在短片方面表现出色,但难以生成连贯的多镜头叙事,due to disjointed visual dynamics and fractured storylines。现有方法要么依赖大量手动脚本/编辑,要么侧重单镜头的保真度而忽视跨场景的连贯性,限制了其在电影级内容中的实用性。我们提出了 VideoGen-of-Thought (VGoT),一个从单句话自动生成多镜头视频的框架,通过系统性地解决三个核心挑战来实现:(1)叙事碎片化:现有方法缺乏结构化叙事。我们提出动态叙事建模,将用户提示转化为简洁的镜头草案,再扩展为五个领域(人物动态、背景连贯性、关系演变、摄影机运动、HDR 照明)的详细规格,并通过自我验证确保逻辑进展。(2)视觉不一致:先前方法难以在不同镜头间保持一致的外观。我们的身份感知跨镜头传递构建身份保持人物轮廓 (IPP) 令牌,在保持人物身份的同时允许受故事需要的控制性trait变更(表情、年龄)。(3)转场伪影:突如其来的镜头切换会破坏代入感。我们的相邻潜在转场机制在转场点处实施边界感知重置策略,处理相邻镜头的特征,实现无缝的视觉流动,同时保持叙事连贯性。在训练自由的管道中,VGoT 在单镜头人脸一致性上超越强基准 20.4%,在风格一致性上提升 17.4%,而只需减少 10 倍的手动调整。VGoT 弥合了从原始视觉合成到导演级叙事之间的鸿沟,实现了自动化的多镜头视频生成。

关键词

引用

@article{arxiv.2412.02259,
  title  = {VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention},
  author = {Mingzhe Zheng and Yongqi Xu and Haojian Huang and Xuran Ma and Yexin Liu and Wenjie Shu and Yatian Pang and Feilong Tang and Qifeng Chen and Harry Yang and Ser-Nam Lim},
  journal= {arXiv preprint arXiv:2412.02259},
  year   = {2025}
}

备注

Code: https://github.com/DuNGEOnmassster/VideoGen-of-Thought.git; Webpage: https://cheliosoops.github.io/VGoT/