M$^3$CS:基于可学习码本与孪生解码器的多目标掩码点建模
计算机视觉与模式识别
2023-09-26 v1
摘要
掩码点建模已成为点云自监督预训练的一种有前景的方案。现有方法将重建原始点或相关特征作为预训练目标。然而,考虑到下游任务的多样性,模型需具备低层与高层表示建模能力,以在预训练中捕获几何细节与语义上下文。为此,提出MCS以使模型具备上述能力。具体而言,以掩码点云为输入,MCS引入两个解码器同时预测掩码表示与原始点。尽管额外解码器使解码过程参数翻倍并可能导致过拟合,我们提出孪生解码器以保持可学习参数数量不变。进一步,我们提出在线码本,在重建掩码点之前将连续令牌投影为离散令牌。如此,可迫使解码器通过令牌组合发挥作用而非记忆每个令牌。综合实验表明,MCS在分类与分割任务上均取得优越性能,优于现有方法。
引用
@article{arxiv.2309.13235,
title = {M$^3$CS: Multi-Target Masked Point Modeling with Learnable Codebook and Siamese Decoders},
author = {Qibo Qiu and Honghui Yang and Wenxiao Wang and Shun Zhang and Haiming Gao and Haochao Ying and Wei Hua and Xiaofei He},
journal= {arXiv preprint arXiv:2309.13235},
year = {2023}
}