中文

Image2Point:利用 2D 图像预训练模型理解 3D 点云

计算机视觉与模式识别 2022-04-26 v3 人工智能 机器人学

摘要

3D 点云与 2D 图像是对物理世界的不同视觉表征。尽管人类视觉能够理解这两种表征,但专为 2D 图像与 3D 点云理解设计的计算机视觉模型却大不相同。本文通过实证考察迁移的可行性、迁移带来的收益,并阐明迁移为何有效,探索了将 2D 模型架构与权重迁移以理解 3D 点云的潜力。我们发现,确实可以使用同一神经网络模型的相同架构与预训练权重来理解图像与点云。具体而言,我们通过复制或膨胀权重,将图像预训练模型迁移为点云模型。我们发现,以极小的代价——仅对输入、输出与归一化层进行微调——对转换后的图像预训练模型(FIP)进行微调,即可在 3D 点云分类上取得具有竞争力的性能,胜过大量采用任务专用架构并使用多种技巧的点云模型。当对整体模型进行微调时,性能进一步提升。同时,FIP 提升了数据效率,在少样本分类上最高达到 10.0 的 top-1 准确率百分比。它还将点云模型达到目标准确率(例如 90% 准确率)的训练速度加快了至多 11.1 倍。最后,我们从神经崩溃(neural collapse)的角度对图像到点云的迁移给出了解释。代码已发布于:\url{https://github.com/chenfengxu714/image2point}。

关键词

引用

@article{arxiv.2106.04180,
  title  = {Image2Point: 3D Point-Cloud Understanding with 2D Image Pretrained Models},
  author = {Chenfeng Xu and Shijia Yang and Tomer Galanti and Bichen Wu and Xiangyu Yue and Bohan Zhai and Wei Zhan and Peter Vajda and Kurt Keutzer and Masayoshi Tomizuka},
  journal= {arXiv preprint arXiv:2106.04180},
  year   = {2022}
}

备注

The code is avaliable at: \url{https://github.com/chenfengxu714/image2point}