中文

EPCL:冻结的 CLIP Transformer 是一种高效的点云编码器

计算机视觉与模式识别 2023-12-12 v3

摘要

预训练-微调范式因预训练模型的高质量表示能力与可迁移性,在 NLP 和 2D 图像领域取得巨大成功。然而,由于点点云序列数量有限,在 3D 点云领域预训练此类强模型十分困难。本文引入高效点云学习(EPCL),一种有效且高效的点云学习器,用于以冻结的 CLIP transformer 直接训练高质量点云模型。我们的 EPCL 在无配对 2D-3D 数据的情况下,通过语义对齐图像特征与点云特征来连接 2D 与 3D 模态。具体而言,输入点云被划分为一系列局部块,由设计的点云 tokenizer 转换为 token 嵌入。这些 token 嵌入与任务 token 拼接后送入冻结的 CLIP transformer 以学习点云表示。其直觉在于,所提点云 tokenizer 将输入点云投影到与 2D 图像相似的统一 token 空间。在 3D 检测、语义分割、分类和少样本学习上的综合实验表明,CLIP transformer 可作为高效点云编码器,且我们的方法在室内外基准上均取得有前景的性能。特别地,相较于同期预训练模型,我们的 EPCL 带来的性能提升为:ScanNet V2 检测 19.7\textbf{19.7} AP50_{50}、S3DIS 分割 4.4\textbf{4.4} mIoU、SemanticKITTI 分割 1.2\textbf{1.2} mIoU。代码见 \url{https://github.com/XiaoshuiHuang/EPCL}。

关键词

引用

@article{arxiv.2212.04098,
  title  = {EPCL: Frozen CLIP Transformer is An Efficient Point Cloud Encoder},
  author = {Xiaoshui Huang and Zhou Huang and Sheng Li and Wentao Qu and Tong He and Yuenan Hou and Yifan Zuo and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2212.04098},
  year   = {2023}
}

备注

AAAI2024