GS-LRM:面向3D高斯溅射的大规模重建模型
计算机视觉与模式识别
2024-05-01 v1
摘要
我们提出GS-LRM(Large Reconstruction Model for 3D Gaussian Splatting),一个可从2-4张稠密定位稀疏图像中预测高质量3D高斯原始的大规模重建模型,在单张A100 GPU上仅需0.23秒。我们的模型具有非常简单的基于Transformer的体系结构;我们对输入定位图像进行 patch化,将拼接后的多视图图像标记传递 through一系列Transformer块,然后直接从这些标记解码最终的每个像素的高斯参数,以实现可微分渲染。与之前的LRM只能重建物体不同,GS-LRM通过预测每个像素的高斯,自然地处理了尺度和复杂度差异很大的场景。我们展示了该模型可分别在Objaverse和RealEstate10K上进行物体和场景捕获训练。在两种情况下,该模型均以显著优于最先进基准的性能表现。我们还展示了该模型在下游3D生成任务中的应用。我们的项目网页地址为:https://sai-bi.github.io/project/gs-lrm/。
关键词
引用
@article{arxiv.2404.19702,
title = {GS-LRM: Large Reconstruction Model for 3D Gaussian Splatting},
author = {Kai Zhang and Sai Bi and Hao Tan and Yuanbo Xiangli and Nanxuan Zhao and Kalyan Sunkavalli and Zexiang Xu},
journal= {arXiv preprint arXiv:2404.19702},
year = {2024}
}
备注
Project webpage: https://sai-bi.github.io/project/gs-lrm/