VFX Creator:基于可控扩散 Transformer 的动画视觉特效生成
计算机视觉与模式识别
2025-04-02 v4
摘要
创造魔法和幻象是电影制作中最激动人心的方面之一,而视觉特效(VFX)则是令人难忘的电影体验背后的动力源泉。尽管生成式人工智能的最新进展推动了通用图像和视频合成的发展,但可控 VFX 生成领域仍然相对未被充分探索。在这项工作中,我们提出了一种将动画 VFX 生成视为图像动画的新范式,即根据用户友好的文本描述和静态参考图像生成动态效果。我们的工作有两个主要贡献:(i)Open-VFX,这是第一个高质量的 VFX 视频数据集,涵盖 15 个不同的效果类别,并标注了文本描述、用于空间条件的实例分割掩码以及用于时间控制的起止时间戳。(ii)VFX Creator,一个基于视频扩散 Transformer 的简单而有效的可控 VFX 生成框架。该模型集成了一个空间和时间可控的 LoRA 适配器,只需最少的训练视频。具体来说,即插即用的掩码控制模块实现了实例级的空间操控,而嵌入在扩散过程中的分词化起止运动时间戳与文本编码器一起,允许对效果的时间和节奏进行精确的时间控制。在 Open-VFX 测试集上的大量实验证明了所提出系统在生成逼真动态效果方面的优越性,在空间和时间可控性方面均达到了最先进的性能和泛化能力。此外,我们引入了一个专门的指标来评估时间控制的精度。通过将传统 VFX 技术与生成式方法相结合,VFX Creator 为高效、高质量的视频特效生成开启了新的可能性,使先进的 VFX 能够为更广泛的受众所使用。
引用
@article{arxiv.2502.05979,
title = {VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer},
author = {Xinyu Liu and Ailing Zeng and Wei Xue and Harry Yang and Wenhan Luo and Qifeng Liu and Yike Guo},
journal= {arXiv preprint arXiv:2502.05979},
year = {2025}
}