中文

Point Transformer V3: 更简单、更快、更强

计算机视觉与模式识别 2024-03-26 v2

摘要

本文的动机并非在注意力机制内寻求创新。相反,它侧重于在点云处理的背景下克服精度与效率之间现有的权衡,并利用规模的力量。从近期 3D 大规模表征学习的进展中汲取灵感,我们认识到模型性能受规模的影响大于受复杂设计的影响。因此,我们提出了 Point Transformer V3 (PTv3),它优先考虑简单性和效率,而非某些对扩展后整体性能影响较小的机制的精度,例如用基于特定模式组织的点云的高效序列化邻域映射来代替 KNN 的精确邻域搜索。这一原则实现了显著的扩展,将感受野从 16 个点扩展到 1024 个点,同时保持高效(与其前身 PTv2 相比,处理速度提升 3 倍,内存效率提升 10 倍)。PTv3 在跨越室内和室外场景的 20 多个下游任务上取得了 SOTA 结果。通过多数据集联合训练的进一步增强,PTv3 将这些结果推向了更高的水平。

关键词

引用

@article{arxiv.2312.10035,
  title  = {Point Transformer V3: Simpler, Faster, Stronger},
  author = {Xiaoyang Wu and Li Jiang and Peng-Shuai Wang and Zhijian Liu and Xihui Liu and Yu Qiao and Wanli Ouyang and Tong He and Hengshuang Zhao},
  journal= {arXiv preprint arXiv:2312.10035},
  year   = {2024}
}

备注

CVPR 2024, code available at Pointcept (https://github.com/Pointcept/PointTransformerV3)