中文

GenVideo:使用 T2I 扩散模型的单次目标图像与形状感知视频编辑

计算机视觉与模式识别 2024-04-22 v1

摘要

基于扩散模型且仅依赖文本提示进行编辑的视频编辑方法,受限于文本提示有限的表达能力而受到阻碍。因此,引入参考目标图像作为视觉指导,对于精确控制编辑过程变得至关重要。此外,当目标图像中对象的形状和大小与源对象不同时,大多数现有方法难以准确编辑视频。为了应对这些挑战,我们提出了“GenVideo”,利用目标图像感知的 T2I 模型进行视频编辑。我们的方法能够处理具有不同形状和大小的目标对象的编辑,同时使用我们新颖的目标与形状感知 InvEdit 掩码保持编辑的时间一致性。此外,我们提出了一种在推理过程中新颖的目标图像感知潜在噪声校正策略,以提高编辑的时间一致性。实验分析表明,GenVideo 能够有效处理具有不同形状对象的编辑,而现有方法在这些情况下均告失败。

关键词

引用

@article{arxiv.2404.12541,
  title  = {GenVideo: One-shot Target-image and Shape Aware Video Editing using T2I Diffusion Models},
  author = {Sai Sree Harsha and Ambareesh Revanur and Dhwanit Agarwal and Shradha Agrawal},
  journal= {arXiv preprint arXiv:2404.12541},
  year   = {2024}
}

备注

CVPRw 2024