中文

DiVE:基于 DiT 的视频生成与增强控制

计算机视觉与模式识别 2024-09-04 v1

摘要

在自动驾驶场景中生成高保真、时序一致的视频面临重大挑战, 例如在角落案例中出现异常驾驶行为。尽管最近提出了解决此问题的视频生成模型, 但基于扩散转换器(DiT)的模型仍缺乏针对多视图视频生成场景潜力的探索。值得注意的是, 我们提出了首个专为生成时序和多视图一致视频、精确匹配给定鸟瞰图布局控制的 DiT 框架。具体而言, 该框架利用无参数的空间视图扩张注意力机制确保跨视图一致性, 其中集成了联合交叉注意力模块和 ControlNet-Transformer 以进一步提高控制精度。为证明我们的优势, 我们在 nuScenes 数据集上进行了广泛的定性比较, 尤其是在一些最具挑战性的角落案例中。总之, 我们证明了在困难条件下, 所提方法在生成长时间、可控且高度一致的视频方面具有有效性。

关键词

引用

@article{arxiv.2409.01595,
  title  = {DiVE: DiT-based Video Generation with Enhanced Control},
  author = {Junpeng Jiang and Gangyi Hong and Lijun Zhou and Enhui Ma and Hengtong Hu and Xia Zhou and Jie Xiang and Fan Liu and Kaicheng Yu and Haiyang Sun and Kun Zhan and Peng Jia and Miao Zhang},
  journal= {arXiv preprint arXiv:2409.01595},
  year   = {2024}
}