中文

用于点云三维深度学习的 VTPNet

计算机视觉与模式识别 2023-05-11 v1

摘要

近来,基于 Transformer 的点云学习方法在各种点云学习基准上取得了良好结果。然而,由于注意力机制需要生成查询、键和值三个特征向量来计算注意力特征,现有大多数基于 Transformer 的点云学习方法在计算全局注意力时通常消耗大量计算时间和内存资源。为解决此问题,我们提出了一种体素-Transformer-点(VTP)块用于提取点云的局部和全局特征。VTP 结合了基于体素、基于点和基于 Transformer 方法的优势,由基于体素的分支(V 分支)、基于点的 Transformer 分支(PT 分支)和基于点的分支(P 分支)组成。V 分支通过低体素分辨率提取点云的粗粒度特征;PT 分支通过在局部邻域和邻域间交叉注意力计算自注意力获得点云的细粒度特征;P 分支使用简化的 MLP 网络生成点云的全局位置信息。此外,为丰富不同尺度下点云的局部特征,我们将 V 分支中的体素尺度和 PT 分支中的邻域球尺度设置为一大一小(大体素尺度与小邻域球尺度,或小球体素尺度与大邻域球尺度)。最后,我们使用 VTP 作为特征提取网络构建用于点云学习的 VTPNet,并在 ModelNet40、ShapeNet Part 和 S3DIS 数据集上执行形状分类、部件分割和语义分割任务。实验结果表明 VTPNet 在三维点云学习中具有良好性能。

关键词

引用

@article{arxiv.2305.06115,
  title  = {VTPNet for 3D deep learning on point cloud},
  author = {Wei Zhou and Weiwei Jin and Qian Wang and Yifan Wang and Dekui Wang and Xingxing Hao and Yongxiang Yu},
  journal= {arXiv preprint arXiv:2305.06115},
  year   = {2023}
}