中文

Style-A-Video:面向任意基于文本的视频风格迁移的敏捷扩散方法

计算机视觉与模式识别 2023-05-10 v1 多媒体

摘要

大规模文本到视频扩散模型已展现出合成多样化视频的卓越能力。然而,由于缺乏大规模文本到视频数据集及训练所需的计算资源,直接将这些模型用于视频风格化仍很困难。此外,由于对输入内容的加噪过程是随机且具有破坏性的,满足风格迁移任务的内容保持标准颇具挑战。本文提出一种名为 Style-A-Video 的零样本视频风格化方法,其利用带有图像潜在扩散模型的生成式预训练 Transformer 来实现简洁的文本控制视频风格化。我们改进了去噪过程中的引导条件,在艺术表达与结构保持之间建立平衡。此外,为减少帧间闪烁并避免额外伪影的形成,我们采用了采样优化与一种时间一致性模块。大量实验表明,我们能在比先前方案消耗更少的情况下,获得优于其内容保持与风格化性能的表现。代码将发布于 https://github.com/haha-lisa/Style-A-Video。

关键词

引用

@article{arxiv.2305.05464,
  title  = {Style-A-Video: Agile Diffusion for Arbitrary Text-based Video Style Transfer},
  author = {Nisha Huang and Yuxin Zhang and Weiming Dong},
  journal= {arXiv preprint arXiv:2305.05464},
  year   = {2023}
}