VideoGen-of-Thought:通过最小人工干预逐步生成多镜头视频
计算机视觉与模式识别
2025-03-21 v2
摘要
当前视频生成模型在短片方面表现出色,但难以生成连贯的多镜头叙事,因为存在视觉动态不连贯和叙事碎片化的问题。现有方法要么依赖大量人工脚本/编辑,要么侧重单镜头的保真度而忽视跨场景的连续性,限制了其在电影类内容中的实用性。我们引入VideoGen-of-Thought(VGoT),一个逐步框架,通过系统性地解决三个核心挑战来自动化生成单句话中的多镜头视频:(1)叙事碎片化:现有方法缺乏结构化叙事。我们提出动态叙事建模,将用户提示转换为简洁的镜头描述,再细化为包含角色动态、背景连续性、关系演变、摄影机运动和HDR照明等五个维度的详细电影化规格,确保逻辑叙事推进并实现自我验证。(2)视觉不一致:现有方法在跨镜头视觉保持方面困难。我们的身份感知跨镜头传递生成保持角色忠实度的身份感知 portrait(IPP)标记,同时允许根据叙事变化呈现表情、年龄等特征。(3)转场瑕疵:突如其来的镜头切换破坏沉浸感。我们的相邻潜在转移机制在转场点处处理相邻镜头的特征,实现无缝的视觉流动,同时保持叙事连续性。VGoT生成的多镜头视频在单镜头人脸一致性上比最新基线提高20.4%,在风格一致性上提高17.4%,跨镜头一致性提升超过100%,人工调整需求比替代方案减少10倍。
引用
@article{arxiv.2503.15138,
title = {VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention},
author = {Mingzhe Zheng and Yongqi Xu and Haojian Huang and Xuran Ma and Yexin Liu and Wenjie Shu and Yatian Pang and Feilong Tang and Qifeng Chen and Harry Yang and Ser-Nam Lim},
journal= {arXiv preprint arXiv:2503.15138},
year = {2025}
}
备注
This paper should be a refined version of arXiv:2412.02259, "VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation", but I mistakenly submit it as a new paper