中文

StableV2V:稳定视频到视频编辑中的形状一致性

计算机视觉与模式识别 2025-12-04 v1

摘要

生成式 AI 的最新进展显著促进了内容创作与编辑,当前的主流研究进一步将这一令人振奋的进展扩展至视频编辑领域。在此过程中,这些研究主要将源视频固有的运动模式迁移至编辑后的视频中,然而由于传递的运动与编辑后的内容之间缺乏特定的对齐,经常观察到与用户提示一致性较差的结果。为解决这一局限性,本文提出了一种形状一致的视频编辑方法,即 StableV2V。该方法将整个编辑流程分解为若干顺序步骤:首先编辑第一帧视频,随后建立传递的运动与用户提示之间的对齐,最终基于该对齐将编辑后的内容传播至所有其他帧。此外,考虑到各种类型的提示与难度,我们构建了一个名为 DAVIS-Edit 的测试基准,用于对视频编辑进行全面评估。实验结果与分析表明,与现有的 SOTA 研究相比,本方法具有优越的性能、视觉一致性与推理效率。

关键词

引用

@article{arxiv.2411.11045,
  title  = {StableV2V: Stablizing Shape Consistency in Video-to-Video Editing},
  author = {Chang Liu and Rui Li and Kaidong Zhang and Yunwei Lan and Dong Liu},
  journal= {arXiv preprint arXiv:2411.11045},
  year   = {2025}
}

备注

Project page: https://alonzoleeeooo.github.io/StableV2V, code: https://github.com/AlonzoLeeeooo/StableV2V, model weights: https://huggingface.co/AlonzoLeeeooo/StableV2V, dataset (DAVIS-Edit): https://huggingface.co/datasets/AlonzoLeeeooo/DAVIS-Edit