VideoAnydoor:高保真视频对象插入与精确运动控制
计算机视觉与模式识别
2025-05-29 v4
摘要
尽管视频生成技术取得了显著进步,但将给定对象插入视频中仍是具挑战的任务。其难点在于同时保留参考对象的外观细节并准确建模连贯运动。在本文中,我们提出VideoAnydoor,一个在零样本条件下实现高保真细节保留与精确运动控制的视频对象插入框架。该框架基于文本到视频模型,利用ID提取器注入全局身份信息,并通过框序列控制整体运动。为保留详细外观并支持细粒度运动控制,我们设计了像素战器。它以任意关键点和对应关键点轨迹为输入,将参考图像中的像素细节按轨迹进行变形,并与扩散U-Net融合,从而提升细节保留效果并支持用户操控运动轨迹。此外,我们提出一种结合视频和静态图像的训练策略,采用加权损失以提升插入质量。VideoAnydoor在实际应用中显著优于现有方法,天然支持无需任务特定微调的多种下游应用(如说话者头部生成、视频虚拟试穿、多区域编辑)。
引用
@article{arxiv.2501.01427,
title = {VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control},
author = {Yuanpeng Tu and Hao Luo and Xi Chen and Sihui Ji and Xiang Bai and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2501.01427},
year = {2025}
}
备注
Accepted by SIGGRAPH2025 Project page: https://videoanydoor.github.io/