PixelGaussian:来自任意视角的通用 3D 高斯重建
计算机视觉与模式识别
2024-10-25 v1 人工智能
机器学习
摘要
我们提出 PixelGaussian,一个高效的前馈框架,用于从任意视角学习通用 3D 高斯重建。大多数现有方法依赖统一的像素级高斯表示,对每个视角学习固定数量的 3D 高斯,难以适应更多输入视角。不同的是,PixelGaussian 动态调整高斯分布和数量 based于几何复杂度,导致更高效的表示并显著提升重建质量。具体而言,我们引入了级联高斯适配器(Cascade Gaussian Adapter, CGA),根据由关键点评分器识别的局部几何复杂度调整高斯分布。CGA 利用基于可变形注意力的上下文感知超网络指导高斯修剪和拆分,确保复杂区域的准确表示同时减少冗余。此外,我们设计了一个基于 Transformer 的迭代高斯细化模块,通过直接的图像-高斯互动来细化高斯表示。我们的 PixelGaussian 可以有效减少随输入视角数量增加而产生的高斯冗余。我们在大型的 ACID 和 RealEstate10K 数据集上进行了广泛实验,其中我们的方法在各种视角数量上实现了业界最佳性能。代码:https://github.com/Barrybarry-Smith/PixelGaussian
引用
@article{arxiv.2410.18979,
title = {PixelGaussian: Generalizable 3D Gaussian Reconstruction from Arbitrary Views},
author = {Xin Fei and Wenzhao Zheng and Yueqi Duan and Wei Zhan and Masayoshi Tomizuka and Kurt Keutzer and Jiwen Lu},
journal= {arXiv preprint arXiv:2410.18979},
year = {2024}
}
备注
Code is available at: https://github.com/Barrybarry-Smith/PixelGaussian