中文

多视图视觉提示融合网络:2D 预训练模型能否提升 3D 点云小样本学习?

计算机视觉与模式识别 2023-08-07 v2 人工智能

摘要

基于点云的 3D 深度模型在自动驾驶、家用机器人等诸多应用中具有广泛用途。受近期自然语言处理中提示学习的启发,本文提出一种新颖的多视图视觉提示融合网络(MvNet)用于少样本 3D 点云分类。MvNet 探究了利用现成 2D 预训练模型实现少样本分类的可能性,从而缓解现有基线模型对大规模标注 3D 点云数据的过度依赖问题。具体而言,MvNet 首先将 3D 点云编码为多个不同视图的图像特征;随后,设计了一种新颖的多视图提示融合模块,以有效融合不同视图的信息,弥合 3D 点云数据与 2D 预训练模型之间的鸿沟。由此可导出一组 2D 图像提示,更好地描述大规模预训练图像模型所需的合适先验知识,用于少样本 3D 点云分类。在 ModelNet、ScanObjectNN 和 ShapeNet 数据集上的大量实验表明,MvNet 在 3D 少样本点云图像分类上取得了新的 SOTA 性能。本工作的源代码将很快公开。

关键词

引用

@article{arxiv.2304.10224,
  title  = {Multi-view Vision-Prompt Fusion Network: Can 2D Pre-trained Model Boost 3D Point Cloud Data-scarce Learning?},
  author = {Haoyang Peng and Baopu Li and Bo Zhang and Xin Chen and Tao Chen and Hongyuan Zhu},
  journal= {arXiv preprint arXiv:2304.10224},
  year   = {2023}
}

备注

10 pages,5 figures