基于 CLIP 的自监督通用 3D 标记化
计算机视觉与模式识别
2025-05-27 v1
摘要
视觉语言模型如 CLIP 可为 3D 场景理解提供有前景的基础,需扩展具备 3D 标记化器。然而,标准方法,如 k 近邻或基于半径的标记化,因对数据集特定空间尺度的敏感性,难以实现跨域泛化。我们提出一种专为尺度不变表示学习而设计的通用 3D 标记化器,适用于冻结的 CLIP 主干网络。我们表明,通过超级点基于分组结合坐标尺度归一化,始终优于传统方法。具体而言,我们引入 S4Token,一种产生无论场景尺度如何的语义信息化标记的标记化管道。我们的标记化器通过掩码点建模和聚类基目标训练,无需注释,同时通过跨模态蒸馏将 3D 标记与 2D 多视角图像特征对齐。对于密集预测任务,我们提出一种超级点级别特征传播模块,以恢复稀疏标记中点级别的细节。
引用
@article{arxiv.2505.18819,
title = {Self-Supervised and Generalizable Tokenization for CLIP-Based 3D Understanding},
author = {Guofeng Mei and Bin Ren and Juan Liu and Luigi Riz and Xiaoshui Huang and Xu Zheng and Yongshun Gong and Ming-Hsuan Yang and Nicu Sebe and Fabio Poiesi},
journal= {arXiv preprint arXiv:2505.18819},
year = {2025}
}
备注
10 pages, tokenizer