中文

ReVideo:通过运动与内容控制重塑视频

计算机视觉与模式识别 2024-05-24 v1

摘要

尽管扩散模型在视频生成与编辑方面取得了显著进展,但实现精准且局部化的视频编辑仍是一个巨大挑战。此外,现有大多数视频编辑方法主要聚焦于改变视觉内容,关于运动编辑的研究则有限。本文提出了一种新颖的尝试,即重塑视频(ReVideo),其与现有方法的不同之处在于通过指定内容与运动,实现对视频特定区域的精准编辑。内容编辑通过修改第一帧实现,而基于轨迹的运动控制提供了直观的用户交互体验。ReVideo 解决了内容控制与运动控制之间耦合与训练不平衡的新任务。为此,我们开发了三阶段的训练策略,逐步从粗到细解耦这两个方面。此外,我们提出了时空自适应融合模块,用于在各种采样步骤和空间位置上整合内容与运动控制。广泛的实验结果表明,我们的 ReVideo 在几项精准视频编辑应用方面表现出色,即(1)保持运动不变时局部更改视频内容,(2)保持内容不变并自定义新的运动轨迹,(3)同时修改内容与运动轨迹。我们的方法还能无需特定训练地将这些应用无缝扩展到多区域编辑,显示出其灵活性和鲁棒性。

关键词

引用

@article{arxiv.2405.13865,
  title  = {ReVideo: Remake a Video with Motion and Content Control},
  author = {Chong Mou and Mingdeng Cao and Xintao Wang and Zhaoyang Zhang and Ying Shan and Jian Zhang},
  journal= {arXiv preprint arXiv:2405.13865},
  year   = {2024}
}