视频中的 Replace Anyone
计算机视觉与模式识别
2025-05-08 v2
摘要
可控人物视频生成领域取得了显著进展, 尤其是凭借扩散模型的出现。然而, 实现对人物运动的精确局部控制(如替换或插入个体同时保持所需运动模式)仍然是巨大的挑战。本文提出 ReplaceAnyone 框架, 专注于具有复杂背景的局部人物替换和插入。具体而言, 将此任务形式化为带姿态引导的图像条件视频填充范式, 利用统一的端到端视频扩散架构实现图像条件视频填充于掩码区域内。为防止形状泄漏并实现细粒度局部控制, 我们引入多种掩码形式, 包括规则和不规则形状。此外, 我们实现丰富的视觉引导机制以增强外观对齐, 引入混合填充编码器以进一步保留掩码视频中详细的背景信息, 并采用两阶段优化方法以简化训练难度。ReplaceAnyone 使能够在单一框架内保持所需姿态运动和参考外观, 实现人物的无缝替换或插入。大量实验结果表明, 本方法在生成真实且连贯的视频内容方面效果显著。该方法可无缝应用于传统 3D-UNet 基模型以及 DiT 基于视频模型如 Wan2.1。代码将在 https://github.com/ali-vilab/UniAnimate-DiT 上提供。
引用
@article{arxiv.2409.19911,
title = {Replace Anyone in Videos},
author = {Xiang Wang and Shiwei Zhang and Haonan Qiu and Ruihang Chu and Zekun Li and Yingya Zhang and Changxin Gao and Yuehuan Wang and Chunhua Shen and Nong Sang},
journal= {arXiv preprint arXiv:2409.19911},
year = {2025}
}