提高视频扩散 Transformer 的相机运动控制
计算机视觉与模式识别
2024-10-15 v1 人工智能
摘要
近期扩散模型的快速发展显著提升了视频生成质量。然而,对相机姿态的精细控制仍是一个挑战。虽然基于 U-Net 的模型在相机控制方面取得了有前景的成果,但基于 Transformer 的扩散模型(DiT)——大规模视频生成的首选架构——在相机运动精度方面存在严重退化。本文我们研究了此问题的根本原因,并针对 DiT 架构提出了解决方案。我们的研究发现,相机控制性能高度依赖于条件化方法的选择,而非常被认为的相机姿态表示。为解决 DiT 中持续的运动退化问题,我们引入了基于 classifier-free guidance 的相机运动指南(CMG),显著提升了相机控制效果(提升超过 400%)。此外,我们还提出了稀疏相机控制管道,大幅简化了长视频相机姿态指定的流程。我们的方法适用于 U-Net 和 DiT 模型,为视频生成任务提供了 improved 的相机控制能力。
引用
@article{arxiv.2410.10802,
title = {Boosting Camera Motion Control for Video Diffusion Transformers},
author = {Soon Yau Cheong and Duygu Ceylan and Armin Mustafa and Andrew Gilbert and Chun-Hao Paul Huang},
journal= {arXiv preprint arXiv:2410.10802},
year = {2024}
}