迈向基于视觉基础模型的无标签场景理解
计算机视觉与模式识别
2023-10-31 v2
摘要
对比视觉-语言预训练(CLIP)和 Segment Anything(SAM)等视觉基础模型在图像分类和分割任务上展现了令人印象深刻的零样本性能。然而,将 CLIP 和 SAM 结合用于无标签场景理解仍有待探索。在本文中,我们研究了视觉基础模型使网络在无标签数据下理解二维和三维世界的潜力。主要挑战在于在极度噪声的伪标签下有效监督网络,这些伪标签由 CLIP 生成并在从二维到三维域的传播过程中进一步恶化。为应对这些挑战,我们提出了一种新颖的跨模态噪声监督(CNS)方法,利用 CLIP 和 SAM 的优势同时监督二维和三维网络。特别地,我们引入预测一致性正则化来协同训练二维和三维网络,随后利用 SAM 的鲁棒特征表示进一步约束网络的潜空间一致性。在多种室内和室外数据集上的实验证明了我们的方法在理解二维和三维开放环境中的优越性能。我们的二维和三维网络在 ScanNet 上以 28.4% 和 33.5% 的 mIoU 实现无标签语义分割,分别提升 4.7% 和 7.9%。对于 nuImages 和 nuScenes 数据集,性能分别为 22.1% 和 26.8%,提升分别为 3.5% 和 6.0%。代码已公开。(https://github.com/runnanchen/Label-Free-Scene-Understanding)
引用
@article{arxiv.2306.03899,
title = {Towards Label-free Scene Understanding by Vision Foundation Models},
author = {Runnan Chen and Youquan Liu and Lingdong Kong and Nenglun Chen and Xinge Zhu and Yuexin Ma and Tongliang Liu and Wenping Wang},
journal= {arXiv preprint arXiv:2306.03899},
year = {2023}
}
备注
NeurIPS 2023