UniTransfer: Video Concept Transfer via Progressive Spatial and Timestep Decomposition
计算机视觉与模式识别
2025-09-26 v1
摘要
我们提出一种新型架构 UniTransfer,通过渐进式空间和时间步分解,实现精准可控的视频概念传递。具体而言,在空间分解方面,我们将视频解耦为三个关键组件:前景主体、背景和运动流。基于这种分解公式,我们进一步引入基于 DiT 的双流到单流架构,以支持对视频不同组件进行细粒度控制。我们还引入基于随机遮蔽的自监督预训练策略,以从大规模无标签视频数据中增强分解表征学习。灵感来自链式思维推理范式,我们进一步重新审视去噪扩散过程,提出链式提示 (Chain-of-Prompt, CoP) 机制,以实现时间步分解。我们将去噪过程分解为三个不同粒度的阶段,并利用大语言模型 (LLM) 为各阶段提供指令,以引导逐步生成。我们还构建了一个以动物为中心的视频数据集 OpenAnimal,以促进视频概念传递研究的进展和基准测试。广泛的实验表明,我们的方法在多样化的参考图像和场景中实现高质量且可控的视频概念传递,在视觉保真度和可编辑性方面超越了现有基线方法。网页:https://yu-shaonian.github.io/UniTransfer-Web/
引用
@article{arxiv.2509.21086,
title = {UniTransfer: Video Concept Transfer via Progressive Spatial and Timestep Decomposition},
author = {Guojun Lei and Rong Zhang and Chi Wang and Tianhang Liu and Hong Li and Zhiyuan Ma and Weiwei Xu},
journal= {arXiv preprint arXiv:2509.21086},
year = {2025}
}
备注
NeuriIPS 2025