Pix4Point:用于 3D 点云理解的基于图像预训练的标准 Transformer
计算机视觉与模式识别
2024-02-05 v3
摘要
尽管 Transformer 在自然语言处理和计算机视觉中取得了令人瞩目的成功,但其在 3D 点云上的表现相对较差。这主要源于 Transformer 的局限:对大量训练数据的迫切需求。遗憾的是,在 3D 点云领域,大型数据集的可用性是一大挑战,加剧了为 3D 任务训练 Transformer 的问题。本工作中,我们从两个角度解决点云 Transformer 的数据问题:(i)引入更多归纳偏置以减少 Transformer 对数据的依赖,以及(ii)依赖跨模态预训练。更具体地,我们首先提出渐进式点块嵌入并给出一个新的点云 Transformer 模型即 PViT。PViT 与 Transformer 共享相同骨干,但被证明对数据需求更少,使 Transformer 能够取得与最先进水平相当的性能。其次,我们构建了一个简单而有效的流程称为“Pix4Point”,可利用在图像域预训练的 Transformer 来增强下游点云理解。这通过一个模态无关的 Transformer 骨干,并借助专用于不同域的 tokenizer 和 decoder 实现。在大量广泛可用的图像上预训练后,PViT 在 ScanObjectNN、ShapeNetPart 和 S3DIS 上的 3D 点云分类、部件分割和语义分割任务中均观察到显著增益。我们的代码和模型可在 https://github.com/guochengqian/Pix4Point 获取。
引用
@article{arxiv.2208.12259,
title = {Pix4Point: Image Pretrained Standard Transformers for 3D Point Cloud Understanding},
author = {Guocheng Qian and Abdullah Hamdi and Xingdi Zhang and Bernard Ghanem},
journal= {arXiv preprint arXiv:2208.12259},
year = {2024}
}
备注
camera-ready version at 3DV 2024