中文

GS-DiT: 通过高效稠密 3D 点追踪利用伪 4D 高斯场推进视频生成

计算机视觉与模式识别 2025-01-07 v1

摘要

4D 视频控制在视频生成中至关重要,因为它能够实现复杂镜头技术的运用,例如多机位拍摄和推拉变焦,而现有方法目前尚不支持这些技术。直接训练视频 Diffusion Transformer (DiT) 来控制 4D 内容需要昂贵的多视角视频。受单目动态新视角合成 (MDVS) 的启发——该方法优化 4D 表示并根据不同的 4D 元素(如相机位姿和物体运动编辑)渲染视频——我们将伪 4D 高斯场引入视频生成。具体而言,我们提出了一个新颖的框架,该框架利用稠密 3D 点追踪构建伪 4D 高斯场,并为所有视频帧渲染该高斯场。然后,我们微调预训练的 DiT,使其遵循渲染视频的引导来生成视频,这被称为 GS-DiT。为了促进 GS-DiT 的训练,我们还提出了一种用于伪 4D 高斯场构建的高效稠密 3D 点追踪 (D3D-PT) 方法。我们的 D3D-PT 在准确率上优于最先进的稀疏 3D 点追踪方法 SpatialTracker,并将推理速度提高了两个数量级。在推理阶段,GS-DiT 能够在保持相同动态内容的同时遵循不同的相机参数生成视频,从而解决了当前视频生成模型的一个重大局限性。GS-DiT 展现出强大的泛化能力,并将 Gaussian splatting 的 4D 可控性扩展到超越仅限相机位姿的视频生成中。它支持通过对高斯场和相机内参的操控来实现高级电影效果,使其成为创意视频制作的强大工具。演示请见 https://wkbian.github.io/Projects/GS-DiT/。

关键词

引用

@article{arxiv.2501.02690,
  title  = {GS-DiT: Advancing Video Generation with Pseudo 4D Gaussian Fields through Efficient Dense 3D Point Tracking},
  author = {Weikang Bian and Zhaoyang Huang and Xiaoyu Shi and Yijin Li and Fu-Yun Wang and Hongsheng Li},
  journal= {arXiv preprint arXiv:2501.02690},
  year   = {2025}
}

备注

Project Page: https://wkbian.github.io/Projects/GS-DiT/