让图像给予你更多:用于形状分析的点云跨模态训练
计算机视觉与模式识别
2022-10-11 v1
摘要
尽管近期点云分析取得了令人印象深刻的进展,但从单一模态进行表示学习的范式逐渐遇到瓶颈。本工作中,我们通过充分利用图像中固有包含的更丰富外观信息(如纹理、颜色和明暗)来迈向更具判别性的 3D 点云表示。具体而言,本文引入一种简单而有效的点云跨模态训练(PointCMT)策略,利用视图图像(即 3D 物体的渲染或投影 2D 图像)来提升点云分析。实践中,为从视图图像中有效获取辅助知识,我们开发了师生框架,并将跨模态学习表述为知识蒸馏问题。PointCMT 通过新颖的特征与分类器增强准则消除不同模态间的分布差异,并有效避免潜在的负迁移。需注意,PointCMT 在不修改架构的情况下有效提升了仅点云表示。充分实验验证了在多种数据集上使用主流骨干网络(即配合 PointCMT,PointNet++ 与 PointMLP 在两个基准上分别取得 94.4% 与 86.7% 准确率,即 ModelNet40 与 ScanObjectNN 上的 SOTA 性能)的显著增益。代码将发布于 https://github.com/ZhanHeshen/PointCMT。
引用
@article{arxiv.2210.04208,
title = {Let Images Give You More:Point Cloud Cross-Modal Training for Shape Analysis},
author = {Xu Yan and Heshen Zhan and Chaoda Zheng and Jiantao Gao and Ruimao Zhang and Shuguang Cui and Zhen Li},
journal= {arXiv preprint arXiv:2210.04208},
year = {2022}
}
备注
To appear in NIPS2022