Concerto:联合 2D-3D 无监督学习涌现空间表征
计算机视觉与模式识别
2026-03-03 v2
摘要
人类通过多感官协同学习抽象概念,一旦形成,这些表征往往可以仅从单一模态中被调用。以此为灵感,我们提出 Concerto,这是一种模拟人类空间认知中概念学习的极简模型,将 3D 内部模态自蒸馏与 2D-3D 跨模态联合嵌入相结合。尽管其简单,Concerto 学习到的空间特征仍较为连贯且信息丰富,零样本可视化即证明了这一点。在线性探测用于 3D 场景感知时,Concerto 在 standalone SOTA 2D 和 3D 无监督模型中分别优势达 14.2% 和 4.8%,以及其特征拼接。充分微调后,Concerto 在多个场景理解基准(例如 ScanNet 上达到 80.7% mIoU)上均取得了新的 SOTA 成绩。我们进一步提出了针对视频提升点云空间表征的 Concerto 变体,以及一个将 Concerto 表征线性投影到 CLIP 语言空间的翻译器,实现开放式感知。这些结果表明,Concerto 涌现出在细粒度几何与语义一致性方面具有优势的空间表征。
引用
@article{arxiv.2510.23607,
title = {Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations},
author = {Yujia Zhang and Xiaoyang Wu and Yixing Lao and Chengyao Wang and Zhuotao Tian and Naiyan Wang and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2510.23607},
year = {2026}
}
备注
NeurIPS 2025, produced by Pointcept, project page: https://pointcept.github.io/Concerto