中文

基于稀疏扩散与三维渲染的静态场景高效相机控制视频生成

计算机视觉与模式识别 2026-01-15 v1

摘要

基于扩散模型的现代视频生成模型能够生成非常逼真的视频片段,但计算效率低下,生成几秒钟的视频往往需要数分钟的GPU时间。这种低效性对在具身人工智能和VR/AR等需要实时交互的应用中部署生成式视频构成了关键障碍。本文探索了一种用于静态场景相机条件视频生成的新策略:使用基于扩散的生成模型生成一组稀疏的关键帧,然后通过三维重建和渲染合成完整视频。通过将关键帧提升为三维表示并渲染中间视图,我们的方法将生成成本分摊到数百帧上,同时强制几何一致性。我们进一步引入了一个模型,该模型能预测给定相机轨迹的最佳关键帧数量,使系统能够自适应地分配计算资源。我们最终的方法SRENDER,对简单轨迹使用非常稀疏的关键帧,对复杂的相机运动则使用更密集的关键帧。这使得在生成20秒视频时,其速度比基于扩散的基线方法快40倍以上,同时保持高视觉保真度和时间稳定性,为高效且可控的视频合成提供了一条实用路径。

关键词

引用

@article{arxiv.2601.09697,
  title  = {Efficient Camera-Controlled Video Generation of Static Scenes via Sparse Diffusion and 3D Rendering},
  author = {Jieying Chen and Jeffrey Hu and Joan Lasenby and Ayush Tewari},
  journal= {arXiv preprint arXiv:2601.09697},
  year   = {2026}
}

备注

Project page: https://ayushtewari.com/projects/srender/