VideoScene: 从视频扩散模型蒸馏生成一步即可生成 3D 场景
计算机视觉与模式识别
2025-04-04 v2
摘要
从稀疏视角恢复 3D 场景是一项具有挑战性的任务,由于其内在的欠定性问题。传统方法已发展出专门的解决方案(例如几何正则化或前馈确定性模型)来缓解此问题。然而,由于输入视角之间的最小重叠且视觉信息不足,这些方法仍会出现性能下降。幸运的是,最近的视频生成模型在解决这一挑战方面显示出前景,因为它们能够生成具有合理 3D 结构的视频片段。基于大规模预训练视频扩散模型,一些开创性的研究开始探索视频生成先验的潜力,并从稀疏视角创建 3D 场景。尽管取得了令人印象深刻的改进,但它们受限于推理速度慢且缺乏 3D 约束,导致效率低下且重构 artifacts 不符合真实世界的几何结构。在本文中,我们提出 VideoScene 通过蒸馏视频扩散模型实现一步生成 3D 场景,旨在构建一个高效且有效的工具来弥合从视频到 3D 的差距。具体而言,我们设计了一种 3D aware 的 leap flow 蒸馏策略,以跳过耗时的冗余信息,并训练动态去噪策略网络以在推理期间自适应确定最佳 leap 步长。大量实验表明,我们的 VideoScene 相比以前的视频扩散模型在 3D 场景生成速度和效果方面都取得了更快和更好的结果,凸显了其作为未来视频到 3D 应用的高效工具的潜力。项目页面: https://hanyang-21.github.io/VideoScene
引用
@article{arxiv.2504.01956,
title = {VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step},
author = {Hanyang Wang and Fangfu Liu and Jiawei Chi and Yueqi Duan},
journal= {arXiv preprint arXiv:2504.01956},
year = {2025}
}
备注
Accepted by CVPR 2025; Project Page: https://hanyang-21.github.io/VideoScene