中文

DynVFX:用动态内容增强真实视频

计算机视觉与模式识别 2025-10-21 v2

摘要

我们提出了一种用新生成的动态内容增强真实世界视频的方法。给定一个输入视频和一个描述所需内容的简单用户文本指令,我们的方法能够合成动态对象或复杂的场景效果,这些内容会随着时间推移自然地与现有场景交互。新内容的位置、外观和运动被无缝集成到原始素材中,同时考虑到相机运动、遮挡以及场景中其他动态对象的交互,从而生成一个连贯且逼真的输出视频。我们通过一个零样本、无需训练的框架来实现这一点,该框架利用预训练的文本到视频扩散 Transformer 来合成新内容,并利用预训练的视觉-语言模型来详细设想增强后的场景。具体来说,我们引入了一种新颖的基于推理的方法,该方法操纵注意力机制中的特征,从而能够准确定位并无缝集成新内容,同时保持原始场景的完整性。我们的方法是全自动的,仅需一个简单的用户指令。我们展示了该方法在应用于真实世界视频的广泛编辑上的有效性,涵盖了涉及相机和物体运动的各种对象和场景。

关键词

引用

@article{arxiv.2502.03621,
  title  = {DynVFX: Augmenting Real Videos with Dynamic Content},
  author = {Danah Yatim and Rafail Fridman and Omer Bar-Tal and Tali Dekel},
  journal= {arXiv preprint arXiv:2502.03621},
  year   = {2025}
}

备注

Project page: https://dynvfx.github.io