中文

用于点云预训练的 Cross-BERT

计算机视觉与模式识别 2023-12-11 v1

摘要

将 BERT 引入跨模态设置中,给其处理多种模态的优化带来了困难。BERT 架构和训练目标都需要进行调整,以整合和建模来自不同模态的信息。在本文中,我们通过探索同一物体/场景的 2D 和 3D 数据之间隐含的语义和几何相关性来应对这些挑战。我们提出了一种新的跨模态 BERT 风格的自监督学习范式,称为 Cross-BERT。为了促进不规则和稀疏点云的预训练,我们设计了两个自监督任务来增强跨模态交互。第一个任务称为点-图像对齐,旨在对齐单模态和跨模态表示之间的特征,以捕获 2D 和 3D 模态之间的对应关系。第二个任务称为掩码跨模态建模,通过整合跨模态交互获得的高维语义信息,进一步改进了 BERT 的掩码建模。通过执行跨模态交互,Cross-BERT 可以在预训练期间平滑地重建被掩码的标记,从而显著提升下游任务的性能。通过实证评估,我们证明 Cross-BERT 在 3D 下游应用中优于现有的最先进方法。我们的工作突显了利用跨模态 2D 知识来增强 3D 点云表示的有效性,以及 BERT 跨模态的可迁移能力。

关键词

引用

@article{arxiv.2312.04891,
  title  = {Cross-BERT for Point Cloud Pretraining},
  author = {Xin Li and Peng Li and Zeyong Wei and Zhe Zhu and Mingqiang Wei and Junhui Hou and Liangliang Nan and Jing Qin and Haoran Xie and Fu Lee Wang},
  journal= {arXiv preprint arXiv:2312.04891},
  year   = {2023}
}