GaussVideoDreamer:基于视频扩散和不一致感知的高斯溅写 3D 场景生成
计算机视觉与模式识别
2025-04-17 v3
摘要
单图像 3D 场景重建面临重大挑战,由于其固有的欠定性和有限的输入约束。最近的进展探索了两个有前景的方向:一是训练于 3D 一致数据集但难以应对超出分布泛化的多视图生成模型,二是依赖深度数据或 3D 平滑性的 3D 场景填充和完成框架,导致跨视图不一致和次优错误处理。基于这些方法,我们提出 GaussVideoDreamer,通过两种关键创新将图像、视频和 3D 生成的优势融合:(1)一种渐进式视频填充策略,利用时序一致性实现更好的多视图一致性和更快收敛。(2)一种 3D 高斯溅写一致性掩码,用于引导视频扩散生成 3D 一致的多视图证据。我们的管道由几何感知的初始化协议、不一致感知的高斯溅写和渐进式视频填充三个核心组件组成。实验结果表明,我们的方法在 diverse 场景下实现了比现有方法高 32% 的 LLaVA-IQA 分数,同时至少实现 2 倍的加速。
引用
@article{arxiv.2504.10001,
title = {GaussVideoDreamer: 3D Scene Generation with Video Diffusion and Inconsistency-Aware Gaussian Splatting},
author = {Junlin Hao and Peiheng Wang and Haoyang Wang and Xinggong Zhang and Zongming Guo},
journal= {arXiv preprint arXiv:2504.10001},
year = {2025}
}