中文

跨模态自训练:对齐图像和点云以进行无标签分类学习

计算机视觉与模式识别 2024-04-17 v1

摘要

大规模视觉2D视觉语言模型,如CLIP,可以与3D编码器对齐,以学习可泛化的(开放词汇)3D视觉模型。然而,当前的方法需要监督预训练来实现这种对齐,并且这种3D零样本模型在现实世界适应中的性能仍然次优。在这项工作中,我们提出了一个优化框架:Cross-MoST:跨模态自训练,通过简单地利用未标记的3D数据及其伴随的2D视图来提高零样本3D视觉模型的无标签分类性能。我们提出了一个师生框架,同时处理2D视图和3D点云,并生成联合伪标签来训练分类器并指导跨模态特征对齐。因此,我们证明了像CLIP这样的2D视觉语言模型可以用于补充3D表示学习,以提高分类性能,而无需昂贵的类别注释。使用合成和真实世界的3D数据集,我们进一步证明了Cross-MoST能够实现高效的跨模态知识交换,从而使图像和点云模态都能从彼此的丰富表示中学习。

关键词

引用

@article{arxiv.2404.10146,
  title  = {Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels},
  author = {Amaya Dharmasiri and Muzammal Naseer and Salman Khan and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2404.10146},
  year   = {2024}
}

备注

To be published in Workshop for Learning 3D with Multi-View Supervision (3DMV) at CVPR 2024