中文

ViPFormer:用于无监督点云理解的高效视觉-点云 Transformer

计算机视觉与模式识别 2023-03-28 v1

摘要

近来,越来越多的工作为点云处理设计无监督范式,以缓解人工标注昂贵与有监督方法迁移性差的局限。其中,CrossPoint 遵循对比学习框架,利用图像与点云数据进行无监督点云理解。尽管其展现了令人期待的性能,但不均衡的架构使其不必要地复杂且低效。例如,CrossPoint 中图像分支比点云分支重约 8.3 倍,导致更高的复杂度与延迟。为解决该问题,本文提出轻量级的视觉-点云 Transformer(ViPFormer),以单一架构统一图像与点云处理。ViPFormer 通过优化模态内与跨模态对比目标以无监督方式学习。随后将预训练模型迁移至多种下游任务,包括 3D 形状分类与语义分割。在不同数据集上的实验表明,ViPFormer 以更高的准确率、更低的模型复杂度与运行延迟超越了以往最优无监督方法。最后,通过大量消融研究验证了 ViPFormer 中各组件的有效性。所提方法的实现见 https://github.com/auniquesun/ViPFormer。

关键词

引用

@article{arxiv.2303.14376,
  title  = {ViPFormer: Efficient Vision-and-Pointcloud Transformer for Unsupervised Pointcloud Understanding},
  author = {Hongyu Sun and Yongcai Wang and Xudong Cai and Xuewei Bai and Deying Li},
  journal= {arXiv preprint arXiv:2303.14376},
  year   = {2023}
}

备注

9 pages, 4 figures, 7 tables; accepted by ICRA 2023