TrailBlazer:基于扩散的视频生成的轨迹控制
计算机视觉与模式识别
2024-04-10 v2
摘要
在近期的文本到视频(T2V)生成方法中,实现合成视频的可控性往往是一个挑战。通常,这一问题通过提供低级逐帧引导来解决,形式包括边缘图、深度图或待修改的现有视频。然而,获取此类引导的过程可能非常耗时。本文聚焦于通过运用简单的边界框以多种方式引导主体,从而增强视频合成的可控性,且无需神经网络训练、微调、推理时优化或使用现有视频。我们的算法 TrailBlazer 构建于预训练的 T2V 模型之上,易于实现。主体通过提出的空间和时间注意力图编辑由边界框引导。此外,我们引入了关键帧概念,允许主体轨迹和整体外观由移动边界框及相应提示共同引导,而无需提供详细掩码。该方法效率高,相对于底层预训练模型的计算开销可忽略不计。尽管边界框引导十分简单,但生成的运动却出奇自然,涌现出包括透视效果以及随着框尺寸增大而朝向虚拟相机移动等效应。
引用
@article{arxiv.2401.00896,
title = {TrailBlazer: Trajectory Control for Diffusion-Based Video Generation},
author = {Wan-Duo Kurt Ma and J. P. Lewis and W. Bastiaan Kleijn},
journal= {arXiv preprint arXiv:2401.00896},
year = {2024}
}
备注
14 pages, 18 figures, Project Page: https://hohonu-vicml.github.io/Trailblazer.Page/