中文

PointTransformerX:无需稀疏算法的便携式高效 3D 点云处理

计算机视觉与模式识别 2026-04-30 v2

摘要

3D 点云感知与自定义 CUDA 算子紧密耦合用于空间操作,这限制了在非 NVIDIA、AMD 及嵌入式硬件上的便携性和效率。我们引入 PointTransformerX (PTX),一个完全基于 PyTorch 的 vision transformer backbone,用于 3D 点云,移除所有自定义 CUDA 算子和外部库,同时保持竞争的准确率。PTX 引入 3D-GS-RoPE,一种旋转位置嵌入,直接在自注意力中编码 3D 空间关系,无需邻域构建;进一步用线性投影取代稀疏卷积补丁嵌入。PTX 探索在推理时扩展注意力窗口以提高准确率而无需重新训练。通过重新设计的前馈网络,PTX 在 ScanNet 上实现 98.7% 的 PointTransformer V3 的准确率,仅需 79.2% 的参数,执行速度快 1.6 倍,仅需 253 MB 内存。PTX 在 NVIDIA GPU、AMD GPU (ROCm) 和 CPU 上原生运行,为点云感知提供了一个高效便携的基础。

关键词

引用

@article{arxiv.2604.24169,
  title  = {PointTransformerX: Portable and Efficient 3D Point Cloud Processing without Sparse Algorithms},
  author = {Laurenz Reichardt and Nikolas Ebert and Oliver Wasenmüller},
  journal= {arXiv preprint arXiv:2604.24169},
  year   = {2026}
}

备注

This paper has been accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026