Scene Splatter:基于动量的单图像 3D 场景生成
计算机视觉与模式识别
2025-04-04 v1 人工智能
摘要
本文提出Scene Splatter方法,采用动量机制对视频扩散进行处理,以从单张图像生成通用场景。现有方法利用视频生成模型合成新视角,受限于视频长度和场景一致性,导致后期重建时出现瑕疵与失真。为此,我们从原始特征构建噪声样本作为动量,以增强视频细节并维持场景一致性。然而,对于感知场跨越已知与未知区域的潜在特征,此类特征级动量限制了视频扩散在未知区域的生成能力。因此,我们进一步将上述一致视频作为像素级动量引入,直接生成无动量的视频,以更好恢复未见区域。我们的级联动量使视频扩散模型能够生成高保真且一致的新视角。我们进一步对全局高斯表示进行微调,利用增强后的帧渲染新帧,以进行动量更新。如此可迭代恢复 3D 场景,规避了视频长度的限制。大量实验表明,本方法在高保真与一致场景生成方面具备广泛的泛化能力和卓越的性能。
引用
@article{arxiv.2504.02764,
title = {Scene Splatter: Momentum 3D Scene Generation from Single Image with Video Diffusion Model},
author = {Shengjun Zhang and Jinzhao Li and Xin Fei and Hao Liu and Yueqi Duan},
journal= {arXiv preprint arXiv:2504.02764},
year = {2025}
}
备注
CVPR 2025