中文

SAVE: 基于结构无关视频编辑的主角多样化

计算机视觉与模式识别 2023-12-06 v1

摘要

受文本到图像(T2I)生成模型蓬勃发展的推动,文本到视频(T2V)生成也取得了显著进展。因此,修改视频中的对象或改变风格等任务已成为可能。然而,先前的工作通常对简单且一致的形状效果良好,但在与原始身体形状差异很大的困难目标上容易失败。在本文中,我们发现了现有视频编辑方法中的偏差问题,该问题限制了新主角的选择范围,并尝试使用传统的图像级个性化方法来解决这个问题。我们采用运动个性化,将运动从单个源视频中分离出来,然后相应地修改主角。为了处理图像和视频之间的自然差异,我们提出了一个带有膨胀文本嵌入的运动词,以恰当地表示源视频中的运动。我们还通过引入一种新颖的伪光流来规范运动词关注适当的运动相关区域,该伪光流从预先计算的注意力图中高效计算得出。最后,我们通过一个额外的伪词将运动与源视频的外观解耦。大量实验证明了我们方法的编辑能力,朝着更多样化和更广泛的视频编辑迈出了一步。

关键词

引用

@article{arxiv.2312.02503,
  title  = {SAVE: Protagonist Diversification with Structure Agnostic Video Editing},
  author = {Yeji Song and Wonsik Shin and Junsoo Lee and Jeesoo Kim and Nojun Kwak},
  journal= {arXiv preprint arXiv:2312.02503},
  year   = {2023}
}

备注

Project website: https://ldynx.github.io/SAVE/