OmniV2V:基于动态内容操控的通用视频生成与编辑
计算机视觉与模式识别
2025-06-03 v1
摘要
Diffusion Transformers (DiT) 的出现为视频生成带来了显著进步,尤其是在文本到视频和图像到视频任务中。尽管视频生成广泛应用于各个领域,但大多数现有模型局限于单一场景,无法通过动态内容操控进行多样化的视频生成与编辑。我们提出 OmniV2V,一种能够基于各种操作跨不同场景生成和编辑视频的视频模型,包括:物体移动、物体添加、掩码引导的视频编辑、试穿、图像补全、图像外扩、人体动画和可控角色视频合成。我们探索了一个统一的动态内容操控注入模块,有效整合了上述任务的需求。此外,我们设计了一个基于 LLaVA 的视觉-文本指令模块,使模型能够有效理解视觉内容与指令之间的对应关系。 furthermore,我们构建了一个全面的多任务数据处理系统。由于各种任务之间存在数据重叠,该系统可以高效地提供数据增强。利用该系统,我们构建了一个多类型、多场景的 OmniV2V 数据集及其对应的 OmniV2V-Test 基准。大量实验表明,在许多视频生成和编辑任务中,OmniV2V 的表现与现有最好的开源和商业模型一样好,有时甚至更好。
引用
@article{arxiv.2506.01801,
title = {OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation},
author = {Sen Liang and Zhentao Yu and Zhengguang Zhou and Teng Hu and Hongmei Wang and Yi Chen and Qin Lin and Yuan Zhou and Xin Li and Qinglin Lu and Zhibo Chen},
journal= {arXiv preprint arXiv:2506.01801},
year = {2025}
}