VFXMaster:通过基于上下文学习解锁动态视觉特效生成
计算机视觉与模式识别
2025-10-30 v1
摘要
视觉特效(VFX)对于数字媒体的表达力至关重要,但其创建仍是生成 AI 的主要挑战。主流方法常依赖单一特效的 LoRA 范式,这既资源密集,又根本无法对未见的特效进行泛化,从而限制了可扩展性和创作能力。为此,我们引入 VFXMaster,首个统一、参考驱动的 VFX 视频生成框架。它将特效生成重新表述为基于上下文的学习任务,使其能够从参考视频中复制多样化的动态特效并映射到目标内容上。此外,它在未见特效类别方面表现出卓越的泛化能力。具体而言,我们设计了基于上下文的条件策略,通过参考示例提示模型。设计了基于上下文的注意力掩码,以精确解耦并注入关键特效属性,使单个统一模型能够无信息泄漏地掌握特效仿制。此外,我们提出了一种高效的单次特效适应机制,以快速从用户提供的单个视频中提升对难以克服的未见特效的泛化能力。广泛的实验表明,我们的方法有效地仿真了各种特效类别,并在跨域特效方面表现突出。为促进未来研究,我们将向社区公开代码、模型和全面数据集。
引用
@article{arxiv.2510.25772,
title = {VFXMaster: Unlocking Dynamic Visual Effect Generation via In-Context Learning},
author = {Baolu Li and Yiming Zhang and Qinghe Wang and Liqian Ma and Xiaoyu Shi and Xintao Wang and Pengfei Wan and Zhenfei Yin and Yunzhi Zhuge and Huchuan Lu and Xu Jia},
journal= {arXiv preprint arXiv:2510.25772},
year = {2025}
}
备注
Project Page URL:https://libaolu312.github.io/VFXMaster/