中文

基于 4D 高斯的单幅景观图像动态场景视频优化

计算机视觉与模式识别 2025-04-09 v1

摘要

为实现景观图像中的真实沉浸式体验,诸如水体和云层等流体元素需要在图像内移动,并从 various camera perspectives 中展现新场景。最近,一门名为 dynamic scene video 的领域涌现,将单图像动画与 3D 摄影结合。这些方法使用伪 3D 空间,通过 Layered Depth Images(LDIs)进行隐式表示。LDIs 将单张图像分割为基于深度的图层,使诸如水体和云层等元素能够在图像内移动,并从不同 camera perspectives 中展现新场景。然而,由于景观通常由连续元素组成(包括流体),将 3D 空间表示为离散图层会导致深度感下降,且在 camera movement 时可能产生畸变。此外,由于其对 3D 空间的隐式建模,输出可能局限于 2D 域,进而降低其 versatility。本文提出通过建模显式表示(具体为 4D 高斯)来代表单幅图像的完整 3D 空间。该框架聚焦于通过生成 single image 的 multi-view images 来优化 3D 高斯,并创建 3D motion 以优化 4D 高斯。我们提出框架的最重要部分是 consistent 3D motion estimation,即估计 multi-view images 间的 common motion,以将 3D 空间中的 motion 置于接近 actual motions 的程度。据我们所知,这是首次尝试在 single landscape image 上进行动画的同时代表完整的 3D 空间。我们的模型通过 various experiments 和 metrics 显示出能为 various landscape images 提供真实的沉浸式体验。大量实验结果均见于 https://cvsp-lab.github.io/ICLR2025_3D-MOM/。

关键词

引用

@article{arxiv.2504.05458,
  title  = {Optimizing 4D Gaussians for Dynamic Scene Video from Single Landscape Images},
  author = {In-Hwan Jin and Haesoo Choo and Seong-Hun Jeong and Heemoon Park and Junghwan Kim and Oh-joon Kwon and Kyeongbo Kong},
  journal= {arXiv preprint arXiv:2504.05458},
  year   = {2025}
}

备注

Accepted by ICLR 2025