中文

IC-Effect:通过上下文学习实现精确高效的视频特效编辑

计算机视觉与模式识别 2025-12-18 v1 人工智能

摘要

我们提出了 IC-Effect,一个基于 DiT 的指令引导框架,用于少样本视频 VFX 编辑,能够合成复杂特效(如火焰、粒子和卡通角色),同时严格保持空间和时间一致性。视频 VFX 编辑极具挑战性,因为注入的特效必须与背景无缝融合,背景必须完全保持不变,且特效模式必须从有限的配对数据中高效学习。然而,现有的视频编辑模型无法满足这些要求。IC-Effect 利用源视频作为干净的上下文条件,利用 DiT 模型的上下文学习能力,实现精确的背景保持和自然的特效注入。两阶段训练策略,包括通用编辑适配和通过 Effect-LoRA 进行特效特定学习,确保了强大的指令遵循能力和鲁棒的特效建模。为进一步提高效率,我们引入了时空稀疏标记化,以高保真度大幅减少计算量。我们还发布了一个涵盖 15 种高质量视觉风格的配对 VFX 编辑数据集。大量实验表明,IC-Effect 能够提供高质量、可控且时间一致的视频特效编辑,为视频创作开辟了新的可能性。

关键词

引用

@article{arxiv.2512.15635,
  title  = {IC-Effect: Precise and Efficient Video Effects Editing via In-Context Learning},
  author = {Yuanhang Li and Yiren Song and Junzhe Bai and Xinran Liang and Hu Yang and Libiao Jin and Qi Mao},
  journal= {arXiv preprint arXiv:2512.15635},
  year   = {2025}
}