OmniVCus:基于多模态控制条件的面向主体的视频定制化
计算机视觉与模式识别
2026-01-01 v3
摘要
现有的 feedforward主体驱动视频定制方法主要研究单主体场景,因为构建多主体训练数据对很难实现。另一方面,如何利用深度、掩码、相机和文本提示等信号来控制和编辑视频中的主体仍是较少探索的难题。本文首先提出一种数据构建管道VideoCus-Factory,用于从无标签且无控制信号(如深度到视频和掩码到视频)的原始视频中生成多主体定制化的训练数据对。基于我们构建的数据,我们开发了用于主体在定制化视频中进行指令式编辑的Image-Video Transfer Mixed (IVTM)训练。随后,我们提出一种扩散Transformer框架OmniVCus,包含两种嵌入机制,即幸运数字嵌入(LE)和时序对齐嵌入(TAE)。LE通过使用训练主体激活更多帧嵌入来实现更多主体的推理。TAE通过将相同的帧嵌入分配给控制token和噪声token,鼓励生成过程从时序对齐的控制信号中提取指导。实验表明,我们的方法在定量和定性评估方面均显著优于最先进的方法。视频演示可在我们的项目页面获取:https://caiyuanhao1998.github.io/project/OmniVCus/。我们的代码、模型和数据已发布于https://github.com/caiyuanhao1998/Open-OmniVCus。
关键词
引用
@article{arxiv.2506.23361,
title = {OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions},
author = {Yuanhao Cai and He Zhang and Xi Chen and Jinbo Xing and Yiwei Hu and Yuqian Zhou and Kai Zhang and Zhifei Zhang and Soo Ye Kim and Tianyu Wang and Yulun Zhang and Xiaokang Yang and Zhe Lin and Alan Yuille},
journal= {arXiv preprint arXiv:2506.23361},
year = {2026}
}
备注
NeurIPS 2025; A data construction pipeline and a diffusion Transformer framework for controllable subject-driven video customization