中文

BulletTime:时间与相机姿态的解耦式视频生成

计算机视觉与模式识别 2025-12-05 v1

摘要

新兴的视频扩散模型在视觉保真度方面取得高水平,但本质上将场景动力学与相机运动耦合,限制了其提供精确空间和时间控制的能力。我们引入一种 4D 可控视频扩散框架,显式解耦场景动力学与相机姿态,实现对场景动力学和相机视点的细粒度操控。我们的框架以连续世界时间序列和相机轨迹作为条件输入,通过注意力层中的 4D 位置编码和用于特征调制的自适应归一化将其注入视频扩散模型。为训练此模型,我们策划了一个独特的数据集,其中时间和相机变化独立参数化;该数据集将对外公开。实验表明,我们的模型在多样化的时间模式和相机轨迹方面实现了稳健的真实世界 4D 控制,同时保持高质量的生成效果,并在可控性方面优于先前工作。详见我们的网站观看视频结果:https://19reborn.github.io/Bullet4D/

关键词

引用

@article{arxiv.2512.05076,
  title  = {BulletTime: Decoupled Control of Time and Camera Pose for Video Generation},
  author = {Yiming Wang and Qihang Zhang and Shengqu Cai and Tong Wu and Jan Ackermann and Zhengfei Kuang and Yang Zheng and Frano Rajič and Siyu Tang and Gordon Wetzstein},
  journal= {arXiv preprint arXiv:2512.05076},
  year   = {2025}
}

备注

Project Page: https://19reborn.github.io/Bullet4D/