中文

GaussTR:基础模型对齐的高斯 Transformer 用于自监督 3D 空间理解

计算机视觉与模式识别 2025-03-25 v2

摘要

3D 语义占用预测是空间理解的基础,然而现有方法由于依赖大量标注数据和计算密集的逐体素表示,在可扩展性和泛化能力上面临挑战。本文提出 GaussTR,一种新颖的基于高斯的 Transformer 框架,通过高斯表示将稀疏 3D 建模与基础模型对齐统一起来,以推进 3D 空间理解。GaussTR 以前馈方式预测稀疏高斯集合来表示 3D 场景。通过将高斯泼溅至 2D 视图并将渲染特征与基础模型对齐,GaussTR 促进了自监督 3D 表示学习,并能在无需显式标注的情况下实现开放词汇语义占用预测。在 Occ3D-nuScenes 数据集上的实验表明,GaussTR 实现了 12.27 mIoU 的 SOTA 零样本性能,并将训练时间减少了 40%。这些结果突显了 GaussTR 在可扩展的整体 3D 空间理解方面的有效性,对自动驾驶和具身智能体具有广阔的应用前景。代码可在 https://github.com/hustvl/GaussTR 获取。

关键词

引用

@article{arxiv.2412.13193,
  title  = {GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial Understanding},
  author = {Haoyi Jiang and Liu Liu and Tianheng Cheng and Xinjie Wang and Tianwei Lin and Zhizhong Su and Wenyu Liu and Xinggang Wang},
  journal= {arXiv preprint arXiv:2412.13193},
  year   = {2025}
}

备注

CVPR 2025