中文

基于 SAM 的掩码化标记预测用于 3D 场景理解

计算机视觉与模式识别 2024-10-18 v2

摘要

Foundation 模型显著性地提升了 2D 任务性能,最近诸如 Bridge3D 等工作通过知识蒸馏成功应用于 3D 场景理解,取得了可观进展。然而,2D 与 3D 表示之间的错位以及 3D 数据集中持续存在的长尾分布仍限制了利用 foundation 模型从 2D 知识蒸馏到 3D 的效果。为解决这些问题,我们引入一种新颖的 SAM 引导的分词方法,使 3D Transformer 结构与区域级知识蒸馏无缝对齐,取代传统的 KNN 基于分词技术。此外,我们实施了组别平衡重新加权策略,以有效解决知识蒸馏中的长尾问题。进一步地,受掩码特征预测近期成功的启发,我们的框架在学生模型中实现了两阶段掩码标记预测过程,其中学生模型同时预测来自第一阶段训练的教师模型所得的全局嵌入和标记级局部嵌入。我们的 methodology 已在多个数据集上验证,包括 SUN RGB-D、ScanNet 和 S3DIS,用于 3D 目标检测和语义分割等任务。结果显示相较于当前最先进的自监督方法,本方法取得了显著改进,在该领域建立了新的基准。

关键词

引用

@article{arxiv.2410.12158,
  title  = {SAM-Guided Masked Token Prediction for 3D Scene Understanding},
  author = {Zhimin Chen and Liang Yang and Yingwei Li and Longlong Jing and Bing Li},
  journal= {arXiv preprint arXiv:2410.12158},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024