StarGen:基于视频扩散模型的时空自回归框架用于可扩展且可控的场景生成
计算机视觉与模式识别
2025-04-15 v4
摘要
近期大型重建和生成模型的进展显著提升了场景重建和新视角生成的效果。然而,由于计算限制,这些大型模型的每一次推理都局限于小范围区域,使得长程一致的场景生成具有挑战性。为此,我们提出了StarGen,一种新型框架,采用预训练的视频扩散模型以自回归方式进行长程场景生成。每个视频片段的生成以空间相邻图像的3D扭曲以及来自先前生成视频片段的重叠图像为条件,提高了在长程场景生成中保持时空一致性的能力,并实现精确的姿态控制。时空条件与各种输入条件兼容,促进了包括稀疏视图插值、持续视图生成和布局条件城市生成等多种任务。定量和定性评估表明,StarGen在可扩展性、保真度和姿态精度方面均优于最先进的方法。项目页面:https://zju3dv.github.io/StarGen。
引用
@article{arxiv.2501.05763,
title = {StarGen: A Spatiotemporal Autoregression Framework with Video Diffusion Model for Scalable and Controllable Scene Generation},
author = {Shangjin Zhai and Zhichao Ye and Jialin Liu and Weijian Xie and Jiaqi Hu and Zhen Peng and Hua Xue and Danpeng Chen and Xiaomeng Wang and Lei Yang and Nan Wang and Haomin Liu and Guofeng Zhang},
journal= {arXiv preprint arXiv:2501.05763},
year = {2025}
}