面向点云视频自监督学习的掩码时空结构预测
计算机视觉与模式识别
2023-08-21 v1 人工智能
摘要
近来,学界在开发从海量标注数据中学习的点云视频理解有效方法方面取得了巨大进展。然而,点云视频的标注通常极其昂贵。此外,通过单一或极少数传统任务(如分类)训练可能不足以学习点云视频中存在的时空结构的细微细节。本文提出掩码时空结构预测(MaST-Pre)方法,以在无人工标注情况下捕获点云视频的结构。MaST-Pre 基于时空点管掩码,并由两个自监督学习任务组成。首先,通过重建被掩码的点管,本方法能够捕获点云视频的外观信息。其次,为学习运动,我们提出时序基数差预测任务,估计点管内点数量的改变。由此,MaST-Pre 被迫对点云视频中的空间与时间结构建模。在 MSRAction-3D、NTU-RGBD、NvGesture 与 SHREC'17 上的大量实验证明了所提方法的有效性。
引用
@article{arxiv.2308.09245,
title = {Masked Spatio-Temporal Structure Prediction for Self-supervised Learning on Point Cloud Videos},
author = {Zhiqiang Shen and Xiaoxiao Sheng and Hehe Fan and Longguang Wang and Yulan Guo and Qiong Liu and Hao Wen and Xi Zhou},
journal= {arXiv preprint arXiv:2308.09245},
year = {2023}
}
备注
Accepted by ICCV 2023