中文

Fairy:快速并行化指令引导的视频到视频合成

计算机视觉与模式识别 2023-12-22 v1

摘要

在本文中,我们介绍了 Fairy,这是一种对图像编辑扩散模型进行的极简而稳健的适配,增强了其在视频编辑应用中的能力。我们的方法以基于锚点的跨帧注意力机制为核心,该机制跨帧隐式传播扩散特征,确保了卓越的时间连贯性与高保真合成。Fairy 不仅解决了以往模型的局限性,包括内存和处理速度问题,还通过独特的数据增强策略提高了时间一致性。该策略使模型对源图像和目标图像中的仿射变换具有等变性。Fairy 极为高效,仅需 14 秒即可生成 120 帧 512x384 视频(以 30 FPS 持续 4 秒),比以往工作快至少 44 倍。一项包含 1000 个生成样本的全面用户研究证实,我们的方法提供了卓越的质量,决定性地超越了现有方法。

关键词

引用

@article{arxiv.2312.13834,
  title  = {Fairy: Fast Parallelized Instruction-Guided Video-to-Video Synthesis},
  author = {Bichen Wu and Ching-Yao Chuang and Xiaoyan Wang and Yichen Jia and Kapil Krishnakumar and Tong Xiao and Feng Liang and Licheng Yu and Peter Vajda},
  journal= {arXiv preprint arXiv:2312.13834},
  year   = {2023}
}

备注

Project website: https://fairy-video2video.github.io