GenCompositor:基于扩散转换器的生成式视频合成
计算机视觉与模式识别
2026-03-20 v2
摘要
视频合成将活体素材与目标视频组合以创建视频制作,作为视频创作和电影制作中的关键技术。传统管道需要大量劳动力和专家协作,导致生产周期延长和人力成本高昂。为此,我们采用生成式模型实现自动化,称为生成式视频合成。这一新任务旨在以交互式方式自适应地将前景视频的身份和运动信息注入目标视频,允许用户自定义最终视频中添加的动态元素的大小、运动轨迹及其他属性。具体而言,我们基于其内在特性设计了一个新型扩散转换器(Diffusion Transformer, DiT)管道。为维持编辑前后目标视频的一致性,我们采用带掩码token注入的轻量级DiT基线背景保留分支。对于继承来自其他来源的动态元素,提出了基于全自注意力的DiT融合模块,以及一种简单而有效的前景增强训练方法。此外,针对基于用户控制将背景与前景视频按不同布局进行融合,我们开发了一种新型位置嵌入,称为扩展旋转位置嵌入(Extended Rotary Position Embedding, ERoPE)。最后,我们精选了包含6.1万组视频的数据集用于该新任务,称为VideoComp。该数据包括完整的动态元素和高质量目标视频。实验表明,我们的方法有效实现了生成式视频合成,在保真度和一致性方面优于现有的解决方案。项目地址为 https://gencompositor.github.io/。
引用
@article{arxiv.2509.02460,
title = {GenCompositor: Generative Video Compositing with Diffusion Transformer},
author = {Shuzhou Yang and Xiaoyu Li and Xiaodong Cun and Guangzhi Wang and Lingen Li and Ying Shan and Jian Zhang},
journal= {arXiv preprint arXiv:2509.02460},
year = {2026}
}
备注
Accepted by ICLR 2026