Ctrl-V:通过边界框控制物体运动实现更高保真度的视频生成
计算机视觉与模式识别
2024-12-10 v3
摘要
可控视频生成因其视频扩散模型的进展而备受关注。在自动驾驶等领域,开发高度精确的物体运动预测至关重要。本文解决了一个关键挑战:如何对物体运动进行精确控制以生成逼真的视频。为此,我们:1) 使用边界框控制物体运动,并将这种控制扩展到像素空间中二维或三维框的渲染;2) 采用一个专门的独立模型,根据物体边界框的先前位置以及(如果需要)未来位置来预测其轨迹;3) 适配并增强一个独立的视频扩散网络,以基于这些高质量的轨迹预测生成视频内容。我们的方法Ctrl-V利用经过修改和微调的稳定视频扩散模型来解决轨迹和视频生成问题。在KITTI、Virtual-KITTI 2、BDD100k和nuScenes数据集上进行的大量实验验证了我们的方法在生成逼真且可控的视频方面的有效性。
引用
@article{arxiv.2406.05630,
title = {Ctrl-V: Higher Fidelity Video Generation with Bounding-Box Controlled Object Motion},
author = {Ge Ya Luo and Zhi Hao Luo and Anthony Gosselin and Alexia Jolicoeur-Martineau and Christopher Pal},
journal= {arXiv preprint arXiv:2406.05630},
year = {2024}
}