中文

NaRCan:集成扩散先验的自然细化标准化图像

计算机视觉与模式识别 2024-10-30 v2

摘要

我们提出一种视频编辑框架 NaRCan,将混合形变场与扩散先验相结合,以生成高质量的自然标准化图像以表示输入视频。该方法利用单畸变模型捕捉全局运动,并采用多层感知器(MLP)捕获局部残差形变,从而增强模型处理复杂视频动力学的能力。通过引入扩散先验,我们确保生成的图像在视觉上保持高质量的自然外观,使所生成的标准化图像适用于各种下游视频编辑任务,这是当前基于标准化的方法难以实现的。此外,我们整合低秩适应(LoRA)微调技术,提出一种噪声与扩散先验更新调度技术,使训练过程加快14倍。大量实验结果表明,我们的方法在各种视频编辑任务中超越了现有方法,生成的视频序列具有连贯性和高质量。请参阅我们的项目页面获取视频结果:https://koi953215.github.io/NaRCan_page/。

关键词

引用

@article{arxiv.2406.06523,
  title  = {NaRCan: Natural Refined Canonical Image with Integration of Diffusion Prior for Video Editing},
  author = {Ting-Hsuan Chen and Jiewen Chan and Hau-Shiang Shiu and Shih-Han Yen and Chang-Han Yeh and Yu-Lun Liu},
  journal= {arXiv preprint arXiv:2406.06523},
  year   = {2024}
}

备注

NeurIPS 2024. Project page: https://koi953215.github.io/NaRCan_page/ Code: https://github.com/koi953215/NaRCan