中文

基于对象视图合成先验的生成式4D场景高斯泼溅

计算机视觉与模式识别 2025-06-17 v1

摘要

我们解决了从具有严重遮挡的单目、多对象视频生成动态4D场景的挑战,并介绍了GenMOJO,一种将基于渲染的可变形3D高斯优化与用于视图合成的生成先验相结合的新方法。虽然现有模型在孤立对象的新视图合成上表现良好,但它们难以泛化到复杂、杂乱的场景。为了解决这个问题,GenMOJO将场景分解为单个对象,为每个对象优化一组可微分的可变形高斯。这种对象级分解允许利用以对象为中心的扩散模型来推断新视角中未观察到的区域。它执行联合高斯泼溅以渲染整个场景,捕获跨对象遮挡,并实现遮挡感知的监督。为了弥合以对象为中心的先验与视频的全局帧中心坐标系之间的差距,GenMOJO使用可微变换,在统一框架内对齐生成和渲染约束。由此产生的模型在空间和时间上生成4D对象重建,并从单目输入生成准确的2D和3D点轨迹。定量评估和感知人类研究证实,与现有方法相比,GenMOJO生成了更逼真的场景新视图和更准确的点轨迹。

关键词

引用

@article{arxiv.2506.12716,
  title  = {Generative 4D Scene Gaussian Splatting with Object View-Synthesis Priors},
  author = {Wen-Hsuan Chu and Lei Ke and Jianmeng Liu and Mingxiao Huo and Pavel Tokmakov and Katerina Fragkiadaki},
  journal= {arXiv preprint arXiv:2506.12716},
  year   = {2025}
}

备注

This is an updated and extended version of our CVPR paper "Robust Multi-Object 4D Generation in Complex Video Scenarios"