VideoRFSplat:基于视频生成的直接场景级文本到 3D 高斯溅射生成,支持灵活姿态和多视角联合建模
计算机视觉与模式识别
2025-03-21 v1 人工智能
摘要
我们提出 VideoRFSplat,一个直接文本到 3D 的模型,利用视频生成模型为无限实际场景生成逼真的 3D 高斯溅射(3DGS)。为生成多样化的摄像机姿态和无限实际场景的空间范围,同时确保对任意文本提示的通用性,之前的方法通过微调 2D 生成模型来联合建模摄像机姿态和多视角图像。但这些方法在将 2D 生成模型扩展到联合建模时因模态差距而不稳定,这需要额外模型来稳定训练和推理。本文我们提出一种架构和采样策略,在微调视频生成模型时联合建模多视角图像和摄像机姿态。我们的核心思想是双流架构,通过通信块将专门的姿态生成模型附加到预训练的视频生成模型上,分别生成多视角图像和摄像机姿态。这种设计减少了姿态和图像模态之间的相互干扰。此外,我们提出一种异步采样策略,使摄像机姿态的去噪速度快于多视角图像,从而利用快速去噪的姿态来条件化多视角生成,减少相互歧义,增强跨模态一致性。在多个大规模真实数据集(RealEstate10K、MVImgNet、DL3DV-10K、ACID)上训练,VideoRFSplat 在不依赖通过评分蒸馏采样进行后处理的现有文本到 3D 直接生成方法上取得优异成绩,且无需此类后处理。
引用
@article{arxiv.2503.15855,
title = {VideoRFSplat: Direct Scene-Level Text-to-3D Gaussian Splatting Generation with Flexible Pose and Multi-View Joint Modeling},
author = {Hyojun Go and Byeongjun Park and Hyelin Nam and Byung-Hoon Kim and Hyungjin Chung and Changick Kim},
journal= {arXiv preprint arXiv:2503.15855},
year = {2025}
}
备注
Project page: https://gohyojun15.github.io/VideoRFSplat/