EPCL:冻结的 CLIP Transformer 是一种高效的点云编码器
计算机视觉与模式识别
2023-12-12 v3
摘要
预训练-微调范式因预训练模型的高质量表示能力与可迁移性,在 NLP 和 2D 图像领域取得巨大成功。然而,由于点点云序列数量有限,在 3D 点云领域预训练此类强模型十分困难。本文引入高效点云学习(EPCL),一种有效且高效的点云学习器,用于以冻结的 CLIP transformer 直接训练高质量点云模型。我们的 EPCL 在无配对 2D-3D 数据的情况下,通过语义对齐图像特征与点云特征来连接 2D 与 3D 模态。具体而言,输入点云被划分为一系列局部块,由设计的点云 tokenizer 转换为 token 嵌入。这些 token 嵌入与任务 token 拼接后送入冻结的 CLIP transformer 以学习点云表示。其直觉在于,所提点云 tokenizer 将输入点云投影到与 2D 图像相似的统一 token 空间。在 3D 检测、语义分割、分类和少样本学习上的综合实验表明,CLIP transformer 可作为高效点云编码器,且我们的方法在室内外基准上均取得有前景的性能。特别地,相较于同期预训练模型,我们的 EPCL 带来的性能提升为:ScanNet V2 检测 AP、S3DIS 分割 mIoU、SemanticKITTI 分割 mIoU。代码见 \url{https://github.com/XiaoshuiHuang/EPCL}。
引用
@article{arxiv.2212.04098,
title = {EPCL: Frozen CLIP Transformer is An Efficient Point Cloud Encoder},
author = {Xiaoshui Huang and Zhou Huang and Sheng Li and Wentao Qu and Tong He and Yuenan Hou and Yifan Zuo and Wanli Ouyang},
journal= {arXiv preprint arXiv:2212.04098},
year = {2023}
}
备注
AAAI2024