中文

DiTCtrl:探索多模态扩散变换器中注意力控制以实现无训练的多提示长视频生成

计算机视觉与模式识别 2025-03-27 v2 人工智能 多媒体

摘要

Sora 等视频生成模型通过多模态扩散变换器 (MM-DiT) 架构取得了显著进展。然而,当前视频生成模型主要聚焦于单提示生成,难以生成包含多个连续提示以更好体现真实场景动态特征的连贯场景。虽然一些开创性工作尝试多提示视频生成,但面临严格的训练数据要求、提示跟随效果弱以及转换不自然等挑战。为此,我们首次提出 DiTCtrl,这是一种基于 MM-DiT 架构的无训练多提示视频生成方法。我们的核心思想是将多提示视频生成任务视为具有平滑过渡的时序视频编辑。为此,我们首先分析 MM-DiT 的注意力机制,发现 3D 全注意力在本质上类似于 UNet 类扩散模型中交叉/自注意力块的注意力行为,能够通过注意力共享在不同提示之间实现基于掩码的精确语义控制,从而实现多提示视频生成。通过精心设计,DiTCtrl 生成的视频在无需额外训练的情况下实现了平滑的过渡和一致的物体运动。此外,我们还提出了 MPVBench,这是一个专为多提示视频生成设计的新基准,用于评估多提示生成的性能。大量实验表明,我们的方法在无额外训练的情况下实现了业界领先的性能。

关键词

引用

@article{arxiv.2412.18597,
  title  = {DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation},
  author = {Minghong Cai and Xiaodong Cun and Xiaoyu Li and Wenze Liu and Zhaoyang Zhang and Yong Zhang and Ying Shan and Xiangyu Yue},
  journal= {arXiv preprint arXiv:2412.18597},
  year   = {2025}
}

备注

CVPR 2025; 21 pages, 23 figures, Project page: https://onevfall.github.io/project_page/ditctrl ; GitHub repository: https://github.com/TencentARC/DiTCtrl