中文

Uni3D:大规模探索统一三维表示

计算机视觉与模式识别 2023-10-11 v1 计算与语言

摘要

过去几年中,针对图像或文本的表示扩展已被广泛研究,并引发了视觉与语言学习的变革。然而,面向 3D 物体与场景的可扩展表示相对未被探索。本工作中,我们提出 Uni3D,一个用于大规模探索统一 3D 表示的 3D 基础模型。Uni3D 使用以 2D 初始化的 ViT 进行端到端预训练,以将 3D 点云特征与图像-文本对齐特征相对齐。通过简单架构与 pretext task,Uni3D 可利用丰富的 2D 预训练模型作为初始化、图像-文本对齐模型作为目标,释放 2D 模型与扩展策略在 3D 世界的巨大潜力。我们高效地将 Uni3D 扩展至十亿参数,并在零样本分类、少样本分类、开放世界理解与部件分割等广泛 3D 任务上创下新纪录。我们展示了强大的 Uni3D 表示亦能支持如 3D 绘画与真实场景检索等应用。我们相信 Uni3D 为探索 3D 域中表示的扩展与效率提供了新方向。

关键词

引用

@article{arxiv.2310.06773,
  title  = {Uni3D: Exploring Unified 3D Representation at Scale},
  author = {Junsheng Zhou and Jinsheng Wang and Baorui Ma and Yu-Shen Liu and Tiejun Huang and Xinlong Wang},
  journal= {arXiv preprint arXiv:2310.06773},
  year   = {2023}
}

备注

Code and Demo: https://github.com/baaivision/Uni3D