MVGamba:将 3D 内容生成统一为状态空间序列建模
计算机视觉与模式识别
2024-12-17 v3
摘要
近期的大型 3D 重建模型(LRMs)通过将多视图扩散模型与可扩展的多视图重建器相结合,能够在亚秒级时间内生成高质量的 3D 内容。当前的工作进一步利用 3D Gaussian Splatting 作为 3D 表示,以提升视觉质量与渲染效率。然而,我们观察到现有的 Gaussian 重建模型常存在多视图不一致与纹理模糊的问题。我们将此归因于在采用强大但计算密集的架构(例如 Transformer)时,对多视图信息传播的妥协。为解决此问题,我们引入了 MVGamba,这是一种通用且轻量级的 Gaussian 重建模型,其特色在于采用基于类 RNN 状态空间模型(SSM)的多视图 Gaussian 重建器。我们的 Gaussian 重建器传播包含多视图信息的因果上下文以进行跨视图自精炼,同时以线性复杂度生成长序列 Gaussian 以进行精细细节建模。结合现成的多视图扩散模型,MVGamba 统一了从单张图像、稀疏图像或文本提示的 3D 生成任务。大量实验表明,MVGamba 在所有 3D 内容生成场景中均优于最先进的基线,且模型大小仅约为后者的 。
引用
@article{arxiv.2406.06367,
title = {MVGamba: Unify 3D Content Generation as State Space Sequence Modeling},
author = {Xuanyu Yi and Zike Wu and Qiuhong Shen and Qingshan Xu and Pan Zhou and Joo-Hwee Lim and Shuicheng Yan and Xinchao Wang and Hanwang Zhang},
journal= {arXiv preprint arXiv:2406.06367},
year = {2024}
}
备注
Accepted by NeurIPS 2024. Code is included in https://github.com/SkyworkAI/MVGamba