DropletVideo:探索整体时空一致性视频生成的数据集与方法
计算机视觉与模式识别
2025-03-11 v1 人工智能
摘要
时空一致性是视频生成中的一个关键研究课题。一段合格的生成视频片段必须在确保情节合理性与连贯性的同时,保持跨视角物体与场景的视觉一致性。先前的研究,尤其是开源项目,主要侧重于时间或空间一致性,或二者的基础结合,例如在提示词后附加对摄像机运动的描述,而不对该运动的结果进行约束。然而,摄像机运动可能会向场景中引入新物体或消除现有物体,从而叠加并影响先前的叙事。尤其是在包含大量摄像机运动的视频中,多个情节之间的相互作用变得愈发复杂。本文引入并探讨了整体时空一致性,考虑了情节推进与摄像机技术之间的协同作用,以及先前内容对后续生成的长期影响。我们的研究涵盖了从数据集构建到模型开发的全过程。首先,我们构建了 DropletVideo-10M 数据集,该数据集包含 1000 万个具有动态摄像机运动和物体动作的视频。每个视频平均标注了 206 个词,详细描述了各种摄像机运动和情节发展。随后,我们开发并训练了 DropletVideo 模型,该模型在视频生成过程中在保持时空连贯性方面表现出色。DropletVideo 数据集和模型可在 https://dropletx.github.io 获取。
引用
@article{arxiv.2503.06053,
title = {DropletVideo: A Dataset and Approach to Explore Integral Spatio-Temporal Consistent Video Generation},
author = {Runze Zhang and Guoguang Du and Xiaochuan Li and Qi Jia and Liang Jin and Lu Liu and Jingjing Wang and Cong Xu and Zhenhua Guo and Yaqian Zhao and Xiaoli Gong and Rengang Li and Baoyu Fan},
journal= {arXiv preprint arXiv:2503.06053},
year = {2025}
}