DragNUWA:通过融合文本、图像与轨迹实现视频生成中的细粒度控制
计算机视觉与模式识别
2023-08-17 v1
摘要
可控视频生成近年来受到广泛关注。然而,两个主要局限依然存在:首先,大多数现有工作聚焦于文本、图像或基于轨迹的控制之一,导致无法在视频中实现细粒度控制。其次,轨迹控制研究仍处于早期阶段,多数实验在如 Human3.6M 等简单数据集上进行。这一限制使模型难以处理开放域图像并有效应对复杂曲线路径。本文提出 DragNUWA,一种基于扩散的开放域视频生成模型。为解决现有工作控制粒度不足的问题,我们同时引入文本、图像与轨迹信息,从语义、空间和时间角度对视频内容提供细粒度控制。为解决当前研究中开放域轨迹控制有限的问题,我们提出三方面轨迹建模:轨迹采样器(TS)以实现任意轨迹的开放域控制,多尺度融合(MF)以不同粒度控制轨迹,以及自适应训练(AT)策略以生成遵循轨迹的一致视频。我们的实验验证了 DragNUWA 的有效性,表明其在视频生成细粒度控制方面具有优越性能。主页链接为 \url{https://www.microsoft.com/en-us/research/project/dragnuwa/}
引用
@article{arxiv.2308.08089,
title = {DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory},
author = {Shengming Yin and Chenfei Wu and Jian Liang and Jie Shi and Houqiang Li and Gong Ming and Nan Duan},
journal= {arXiv preprint arXiv:2308.08089},
year = {2023}
}