中文

DragNUWA:通过融合文本、图像与轨迹实现视频生成中的细粒度控制

计算机视觉与模式识别 2023-08-17 v1

摘要

可控视频生成近年来受到广泛关注。然而,两个主要局限依然存在:首先,大多数现有工作聚焦于文本、图像或基于轨迹的控制之一,导致无法在视频中实现细粒度控制。其次,轨迹控制研究仍处于早期阶段,多数实验在如 Human3.6M 等简单数据集上进行。这一限制使模型难以处理开放域图像并有效应对复杂曲线路径。本文提出 DragNUWA,一种基于扩散的开放域视频生成模型。为解决现有工作控制粒度不足的问题,我们同时引入文本、图像与轨迹信息,从语义、空间和时间角度对视频内容提供细粒度控制。为解决当前研究中开放域轨迹控制有限的问题,我们提出三方面轨迹建模:轨迹采样器(TS)以实现任意轨迹的开放域控制,多尺度融合(MF)以不同粒度控制轨迹,以及自适应训练(AT)策略以生成遵循轨迹的一致视频。我们的实验验证了 DragNUWA 的有效性,表明其在视频生成细粒度控制方面具有优越性能。主页链接为 \url{https://www.microsoft.com/en-us/research/project/dragnuwa/}

关键词

引用

@article{arxiv.2308.08089,
  title  = {DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory},
  author = {Shengming Yin and Chenfei Wu and Jian Liang and Jie Shi and Houqiang Li and Gong Ming and Nan Duan},
  journal= {arXiv preprint arXiv:2308.08089},
  year   = {2023}
}