中文

XCube:使用稀疏体素层级结构的大规模 3D 生成式建模

计算机视觉与模式识别 2024-06-26 v2 图形学 机器学习

摘要

我们提出了 XCube(简写为 X3\mathcal{X}^3),一种用于具有任意属性的高分辨率稀疏 3D 体素网格的新型生成模型。我们的模型能够以前馈方式生成数百万个体素,最精细的有效分辨率高达 102431024^3,且无需耗时的测试时优化。为实现这一点,我们采用了一种层级体素隐式扩散模型,该模型使用基于高效 VDB 数据结构构建的定制框架,以由粗到细的方式生成分辨率逐渐增高的网格。除了生成高分辨率物体外,我们还在 100m×\times100m 规模的大型室外场景上证明了 XCube 的有效性,其体素尺寸可小至 10cm。我们观察到相较于以往方法有明显的定性和定量改进。除了无条件生成外,我们还展示了我们的模型可用于解决多种任务,例如用户引导编辑、基于单次扫描的场景补全以及文本到 3D。源代码和更多结果可在 https://research.nvidia.com/labs/toronto-ai/xcube/ 获取。

关键词

引用

@article{arxiv.2312.03806,
  title  = {XCube: Large-Scale 3D Generative Modeling using Sparse Voxel Hierarchies},
  author = {Xuanchi Ren and Jiahui Huang and Xiaohui Zeng and Ken Museth and Sanja Fidler and Francis Williams},
  journal= {arXiv preprint arXiv:2312.03806},
  year   = {2024}
}

备注

CVPR 2024 Highlight. Code: https://github.com/nv-tlabs/XCube/ Website: https://research.nvidia.com/labs/toronto-ai/xcube/