中文

DreamSwapV:面向任意定制视频编辑的掩码引导主体替换

计算机视觉与模式识别 2025-08-21 v1

摘要

随着视频生成的快速发展,对定制视频编辑的需求激增,其中主体替换是一个关键组成部分,但仍有待深入探索。当前主流的替换方法要么专注于狭窄领域——如人体动画或手物交互——要么依赖某种间接编辑范式或模糊的文本提示,这损害了最终保真度。本文提出 DreamSwapV,一个掩码引导、主体无关的端到端框架,它利用用户指定的掩码和参考图像,替换任何视频中的任何主体以实现定制化。为注入细粒度引导,我们引入了多种条件和一个专用的条件融合模块,以高效地整合它们。此外,还设计了一种自适应掩码策略,以适应不同尺度和属性的主体,进一步改善被替换主体与其周围环境之间的交互。通过我们精心设计的两阶段数据集构建和训练方案,DreamSwapV 优于现有方法,这一点通过在 VBench 指标和我们首次引入的 DreamSwapV-Benchmark 上的全面实验得到了验证。

关键词

引用

@article{arxiv.2508.14465,
  title  = {DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing},
  author = {Weitao Wang and Zichen Wang and Hongdeng Shen and Yulei Lu and Xirui Fan and Suhui Wu and Jun Zhang and Haoqian Wang and Hao Zhang},
  journal= {arXiv preprint arXiv:2508.14465},
  year   = {2025}
}