中文

MagicProp:基于扩散模型的运动感知外观传播视频编辑方法

计算机视觉与模式识别 2023-09-06 v1

摘要

本文研究在保持视频运动的同时修改其视觉外观的问题。提出一种名为 MagicProp 的新框架,将视频编辑过程解耦为两个阶段:外观编辑与运动感知外观传播。第一阶段,MagicProp 从输入视频中选取单帧,并应用图像编辑技术修改该帧的内容及/或风格。这些技术的灵活性支持对帧内任意区域进行编辑。第二阶段,MagicProp 以编辑后的帧作为外观参考,采用自回归渲染方式生成剩余帧。为此,开发了名为 PropDPM 的基于扩散的条件生成模型,其通过以参考外观、目标运动及前一帧外观为条件来合成目标帧。该自回归编辑方式确保了结果视频的时间一致性。总体而言,MagicProp 将图像编辑技术的灵活性与自回归建模的优异时间一致性相结合,能够在输入视频任意区域灵活编辑对象类型与美学风格,同时保持跨帧良好的时间一致性。多种视频编辑场景下的广泛实验证明了 MagicProp 的有效性。

关键词

引用

@article{arxiv.2309.00908,
  title  = {MagicProp: Diffusion-based Video Editing via Motion-aware Appearance Propagation},
  author = {Hanshu Yan and Jun Hao Liew and Long Mai and Shanchuan Lin and Jiashi Feng},
  journal= {arXiv preprint arXiv:2309.00908},
  year   = {2023}
}