Omni-Effects:统一且空间可控的视觉效果生成
计算机视觉与模式识别
2025-12-18 v4 人工智能
摘要
视觉效果(VFX)是现代电影制作中不可或缺的核心视觉增强手段。尽管视频生成模型为 VFX 制作提供了经济高效的解决方案,但当前方法受限于逐效果的 LoRA 训练,导致生成局限于单一效果。这一根本性限制阻碍了需要空间可控复合效果(即在指定位置同时生成多种效果)的应用。然而,将多样化效果集成到一个统一框架中面临重大挑战:多 VFX 联合训练时的效果变化干扰和空间不可控性。为应对这些挑战,我们提出了 Omni-Effects,这是首个能够生成提示引导效果和空间可控复合效果的统一框架。我们框架的核心包含两项关键创新:(1)基于 LoRA 的专家混合(LoRA-MoE),它采用一组专家 LoRA,将多样化效果集成在一个统一模型中,同时有效缓解跨任务干扰。(2)空间感知提示(SAP),将空间掩码信息融入文本标记,实现精确的空间控制。此外,我们在 SAP 中引入了一个独立信息流(IIF)模块,用于隔离对应各个效果的控制信号,以防止任何不必要的混合。为促进这项研究,我们通过结合图像编辑和首尾帧到视频(FLF2V)合成的新型数据收集流程,构建了一个全面的 VFX 数据集 Omni-VFX,并引入了一个专用的 VFX 评估框架来验证模型性能。大量实验表明,Omni-Effects 实现了精确的空间控制和多样化的效果生成,使用户能够指定所需效果的类别和位置。
引用
@article{arxiv.2508.07981,
title = {Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation},
author = {Fangyuan Mao and Aiming Hao and Jintao Chen and Dongxia Liu and Xiaokun Feng and Jiashu Zhu and Meiqi Wu and Chubin Chen and Jiahong Wu and Xiangxiang Chu},
journal= {arXiv preprint arXiv:2508.07981},
year = {2025}
}
备注
Accepted to AAAI2026