EffectMaker:统一推理与生成用于定制化视觉特效创建
计算机视觉与模式识别
2026-03-09 v1
摘要
视觉特效(VFX)对于增强视频内容的表达性和创造性至关重要,但高质量特效的生产通常需要专业知识和高昂的生产流程。现有的 AIGC 系统在 VFX 生成方面面临数据稀缺和难以建模超常或抽象特效的挑战。此外,这些方法通常需要针对每个特效进行微调,这严重限制了其规模和对新颖 VFX 的泛化能力。本文提出 EffectMaker,一个统一的推理-生成框架,使能够基于参考实现定制化 VFX。EffectMaker 使用多模态大型语言模型解释高层次特效语义并推断其如何适应目标主体,同时利用基于上下文学习的扩散变换器捕获参考视频中的细粒度视觉线索。这两个组件形成一种语义-视觉双路径引导机制,使能够在无需针对每个特效进行微调的情况下实现准确、可控且特效一致的合成。此外,我们构建了 EffectData,包含 130k 个视频、覆盖 3k 个 VFX 类别的大型高质量合成数据集,以提高泛化和规模。实验表明,EffectMaker 在视觉质量和特效一致性方面优于最先进的基线,为定制化 VFX 生成提供了可扩展且灵活的范式。项目页面: https://effectmaker.github.io
引用
@article{arxiv.2603.06014,
title = {EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation},
author = {Shiyuan Yang and Ruihuang Li and Jiale Tao and Shuai Shao and Qinglin Lu and Jing Liao},
journal= {arXiv preprint arXiv:2603.06014},
year = {2026}
}
备注
Project page: https://effectmaker.github.io