中文

Sparkle:通过解耦引导实现生动的指令引导视频背景替换

计算机视觉与模式识别 2026-05-08 v1 人工智能

摘要

近年来,Senorita-2M等开源工作推动了视频编辑向自然语言指令方向发展。然而,当前公开可用的数据集主要集中于局部编辑或风格迁移,这些任务在很大程度上保留了原始场景结构且更容易扩展规模。相比之下,背景替换——这一在电影制作和广告等创意应用中至关重要的任务——需要合成全新的、时间一致的场景,同时保持准确的前景-背景交互,这使得大规模数据生成更具挑战性。因此,由于缺乏高质量训练数据,这一复杂任务在很大程度上仍未被充分探索。这种差距在表现不佳的SOTA模型中显而易见,例如Kiwi-Edit,因为包含此任务的主要开源数据集(即OpenVE-3M)经常产生静态、不自然的背景。在本文中,我们将这种质量退化追溯到数据合成过程中缺乏精确的背景引导。因此,我们设计了一个可扩展的流水线,以解耦方式生成前景和背景引导,并进行严格的质量过滤。基于此流水线,我们引入了Sparkle,一个包含约14万个视频对的数据集,涵盖五种常见的背景变化主题,以及Sparkle-Bench——迄今为止为背景替换量身定制的最大评估基准。实验表明,我们的数据集及基于其训练的模型在OpenVE-Bench和Sparkle-Bench上均取得了显著优于所有现有基线的性能。我们提出的数据集、基准和模型已在 https://showlab.github.io/Sparkle/ 完全开源。

关键词

引用

@article{arxiv.2605.06535,
  title  = {Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled Guidance},
  author = {Ziyun Zeng and Yiqi Lin and Guoqiang Liang and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2605.06535},
  year   = {2026}
}

备注

Tech Report. Project Page: https://showlab.github.io/Sparkle/