P2P:利用点到像素提示调优预训练图像模型用于点云分析
计算机视觉与模式识别
2022-10-13 v2 人工智能
机器学习
摘要
如今,在大规模数据集上预训练大模型已成为深度学习中的关键课题。具有高表示能力与可迁移性的预训练模型取得了巨大成功,并主导了自然语言处理和2D视觉中的许多下游任务。然而,鉴于训练数据有限且相对不便收集,将此种预训练-调优范式推广到3D视觉并非易事。本文中,我们提供一种在3D领域利用预训练2D知识解决该问题的新视角,以微小参数代价通过新颖的点到像素提示(Point-to-Pixel prompting)调优预训练图像模型进行点云分析。遵循提示工程原则,我们将点云转换为保持几何的投影与几何感知着色的彩色图像,以适应预训练图像模型,其权重在点云分析任务的端到端优化中保持冻结。我们进行了大量实验证明,配合我们提出的点到像素提示,更好的预训练图像模型将在3D视觉中带来持续更好的性能。得益于图像预训练领域的蓬勃发展,我们的方法在ScanObjectNN最难设定下达到89.3%准确率,以远少得多的可训练参数超越传统点云模型。我们的框架在ModelNet分类和ShapeNet Part Segmentation上也展现出极具竞争力的性能。代码见 https://github.com/wangzy22/P2P。
引用
@article{arxiv.2208.02812,
title = {P2P: Tuning Pre-trained Image Models for Point Cloud Analysis with Point-to-Pixel Prompting},
author = {Ziyi Wang and Xumin Yu and Yongming Rao and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2208.02812},
year = {2022}
}
备注
Accepted to NeurIPS 2022, project page: https://p2p.ivg-research.xyz