无调参的视频视觉效果迁移
计算机视觉与模式识别
2026-02-20 v4
摘要
我们提出了 RefVFX,一个新的框架,用于将复杂的时序效果从参考视频迁移到目标视频或图像,且以前馈方式实现。虽然现有方法在基于提示或关键帧条件的编辑方面表现优异,但在处理动态时序效果(如动态光照变化或人物变形)时难以通过文本或静态条件进行描述。将视频效果迁移具有挑战性,因为模型必须将新的时序动力学与输入视频现有的运动和外观集成。% 为此,我们引入了一个大规模的三元组数据集,其中每个三元组包含一个参考效果视频、一个输入图像或视频,以及对应的输出视频,描绘了迁移后效果。创建此数据并不容易,尤其是视频到视频效果三元组,这些数据并不存在自然的形态。为生成这些数据,我们提出了一种可扩展的自动化管道,用于创建高质量的配对视频,以保持输入的运动和结构,同时基于某些固定、可重复的效果进行转换。我们随后通过 LoRA 适配器和基于代码的时序效果通过程序化组合来增强此数据中的图像到视频效果。基于我们新的数据集,我们使用最新的文本到视频 backbone 训练我们的参考条件模型。实验结果表明,RefVFX 产生视觉上一致且时序上连贯的编辑,能够推广到看不见的效果类别,并在定量指标和人类偏好方面超越了仅基于提示的基线。请参阅我们的网站 https://snap-research.github.io/RefVFX/
引用
@article{arxiv.2601.07833,
title = {Tuning-free Visual Effect Transfer across Videos},
author = {Maxwell Jones and Rameen Abdal and Or Patashnik and Ruslan Salakhutdinov and Sergey Tulyakov and Jun-Yan Zhu and Kuan-Chieh Jackson Wang},
journal= {arXiv preprint arXiv:2601.07833},
year = {2026}
}
备注
Project Page: https://snap-research.github.io/RefVFX/