面向三维点云序列的时空Transformer
计算机视觉与模式识别
2021-10-20 v1
摘要
在三维点云序列中有效学习时空信息对于许多下游任务(如4D语义分割和3D动作识别)极为重要。本文提出一种名为点时空Transformer(PST2)的新框架,从动态三维点云序列中学习时空表示。我们的PST2由两个主要模块组成:时空自注意力(STSA)模块和分辨率嵌入(RE)模块。引入STSA模块以捕获相邻帧间的时空上下文信息,而提出RE模块以聚合邻域特征从而增强特征图的分辨率。我们在点云序列上通过两项不同任务(即4D语义分割和3D动作识别)验证了PST2的有效性。在三个基准数据集上的大量实验表明,我们的PST2在所有数据集上均优于现有方法。消融实验也证实了STSA和RE模块的有效性。
引用
@article{arxiv.2110.09783,
title = {Spatial-Temporal Transformer for 3D Point Cloud Sequences},
author = {Yimin Wei and Hao Liu and Tingting Xie and Qiuhong Ke and Yulan Guo},
journal= {arXiv preprint arXiv:2110.09783},
year = {2021}
}