MAPLE:面向半监督点云动作识别的掩码伪标签自编码器
计算机视觉与模式识别
2022-09-02 v1
摘要
从点云视频中识别人体动作因其在自动驾驶、机器人等广泛应用而备受学界与业界关注。然而,当前点云动作识别方法通常需要大量人工标注数据及高计算成本的复杂骨干网络,难以实用。因此,本文研究半监督点云动作识别任务。我们提出掩码伪标签自编码器(MAPLE)框架,以极少标注学习点云动作识别的有效表征。具体而言,我们设计新颖高效的解耦时空Transformer(DestFormer)作为MAPLE骨干。在DestFormer中,4D点云视频的时空维度被解耦,以实现高效自注意力,学习长时与短时特征。此外,为从更少标注学习判别性特征,我们设计掩码伪标签自编码器结构,引导DestFormer从可见帧重建被掩码帧特征。更重要的是,对于无标签数据,我们利用分类头的伪标签作为掩码帧特征重建的监督信号。最终,充分实验表明MAPLE在三个公开基准上取得优越结果,并在MSR-Action3D数据集上以8.08%准确率超越SOTA方法。
引用
@article{arxiv.2209.00407,
title = {MAPLE: Masked Pseudo-Labeling autoEncoder for Semi-supervised Point Cloud Action Recognition},
author = {Xiaodong Chen and Wu Liu and Xinchen Liu and Yongdong Zhang and Jungong Han and Tao Mei},
journal= {arXiv preprint arXiv:2209.00407},
year = {2022}
}
备注
11 pages, 7 figures