中文

MM-Point:多视角信息增强的多模态自监督3D点云理解

计算机视觉与模式识别 2024-03-11 v3 人工智能 多媒体

摘要

在感知领域,整合多感知信息将2D视角的视觉信息映射到3D物体上,这有助于理解3D环境。然而,对于单个从不同角度渲染的2D视图,只能提供有限的局部分析信息。多视角2D信息的丰富性和价值可以为3D物体提供更优的自监督信号。本文提出一种新型自监督点云表示学习方法MM-Point,其由局部模态和跨模态相似性目标驱动。MM-Point的核心在于同时在3D物体和多个2D视图之间进行多模态交互和传输。为了更有效地基于对比学习实现2D多视角信息的一致跨模态目标,我们进一步提出了Multi-MLP和Multi-level Augmentation策略。通过精心设计的转换策略,我们进一步学习了2D多视角的多级不变性。MM-Point在各种下游任务中表现出领先的性能。例如,在合成数据集ModelNet40上达到峰值准确率92.4%,在真实世界数据集ScanObjectNN上达到最高准确率87.8%,与完全监督方法相当。此外,我们还展示了其在few-shot分类、3D零件分割和3D语义分割等任务中的有效性。

关键词

引用

@article{arxiv.2402.10002,
  title  = {MM-Point: Multi-View Information-Enhanced Multi-Modal Self-Supervised 3D Point Cloud Understanding},
  author = {Hai-Tao Yu and Mofei Song},
  journal= {arXiv preprint arXiv:2402.10002},
  year   = {2024}
}

备注

Accepted by AAAI 2024