基于流动的一致视频编辑:图像到视频生成
计算机视觉与模式识别
2025-06-16 v2 人工智能
摘要
随着视频扩散模型的兴盛,下游应用如视频编辑在不耗费大量计算资源的情况下得到了显著提升。特定挑战在于从源视频传递运动到编辑后视频的过程中,需要考虑中间形变,同时保持生成视频序列的时间一致性。然而,现有方法未能建模复杂的运动模式,严格限制于对象替换,导致非刚性对象运动(如多对象和肖像编辑)被大量忽视。本文观察到光流在复杂运动建模方面具有前景,并提出 FlowV2V 将视频编辑重新审视为基于流动的图像到视频 (I2V) 生成任务。具体而言,FlowV2V 将整个管道分解为帧级编辑和条件 I2V 生成,模拟与变形形状一致的伪光流序列,从而确保编辑过程中的一致性。在 DAVIS-EDIT 上的实验结果显示,FlowV2V 在 DOVER 和错位误差上分别提高了 13.67% 和 50.66%,显示出在时间一致性和样本质量方面优于现有最先进方法的优势。此外,我们对 first-frame 范式和流对齐在所提出方法中的内部功能进行了全面的消融研究。
引用
@article{arxiv.2506.07713,
title = {Consistent Video Editing as Flow-Driven Image-to-Video Generation},
author = {Ge Wang and Songlin Fan and Hangxu Liu and Quanjian Song and Hewei Wang and Jinfeng Xu},
journal= {arXiv preprint arXiv:2506.07713},
year = {2025}
}
备注
16 pages, 12 figures