MM-Point:多视角信息增强的多模态自监督3D点云理解
计算机视觉与模式识别
2024-03-11 v3 人工智能
多媒体
摘要
在感知领域,整合多感知信息将2D视角的视觉信息映射到3D物体上,这有助于理解3D环境。然而,对于单个从不同角度渲染的2D视图,只能提供有限的局部分析信息。多视角2D信息的丰富性和价值可以为3D物体提供更优的自监督信号。本文提出一种新型自监督点云表示学习方法MM-Point,其由局部模态和跨模态相似性目标驱动。MM-Point的核心在于同时在3D物体和多个2D视图之间进行多模态交互和传输。为了更有效地基于对比学习实现2D多视角信息的一致跨模态目标,我们进一步提出了Multi-MLP和Multi-level Augmentation策略。通过精心设计的转换策略,我们进一步学习了2D多视角的多级不变性。MM-Point在各种下游任务中表现出领先的性能。例如,在合成数据集ModelNet40上达到峰值准确率92.4%,在真实世界数据集ScanObjectNN上达到最高准确率87.8%,与完全监督方法相当。此外,我们还展示了其在few-shot分类、3D零件分割和3D语义分割等任务中的有效性。
引用
@article{arxiv.2402.10002,
title = {MM-Point: Multi-View Information-Enhanced Multi-Modal Self-Supervised 3D Point Cloud Understanding},
author = {Hai-Tao Yu and Mofei Song},
journal= {arXiv preprint arXiv:2402.10002},
year = {2024}
}
备注
Accepted by AAAI 2024