中文

一种用于基于骨架的动作分割的解耦时空框架

计算机视觉与模式识别 2023-12-12 v1

摘要

有效地建模具有区分性的时空信息对于在长动作序列中分割活动至关重要。然而,我们观察到,由于两种形式的耦合建模,现有方法在时空建模能力方面受到限制:(i) 级联交互耦合了空间和时间建模,在长序列上过度平滑了运动建模,以及 (ii) 关节共享的时间建模采用共享权重对每个关节进行建模,忽略了不同关节的不同运动模式。我们提出了一种解耦时空框架 来解决上述问题。首先,我们解耦级联的时空交互,以避免堆叠多个时空块,同时实现充分的时空交互。具体而言,DeST 执行一次统一的空间建模,并将空间特征划分为不同的子特征组,这些子特征组随后与来自不同层的时间特征自适应交互。由于不同的子特征包含不同的空间语义,模型可以在每一层学习最优的交互模式。同时,受不同关节以不同速度运动这一事实的启发,我们提出了关节解耦时间建模,采用独立可训练的权重来捕获每个关节的独特时间特征。在四个不同场景的大规模基准测试上,DeST 以更低的计算复杂度显著优于当前 SOTA 方法。

关键词

引用

@article{arxiv.2312.05830,
  title  = {A Decoupled Spatio-Temporal Framework for Skeleton-based Action Segmentation},
  author = {Yunheng Li and Zhongyu Li and Shanghua Gao and Qilong Wang and Qibin Hou and Ming-Ming Cheng},
  journal= {arXiv preprint arXiv:2312.05830},
  year   = {2023}
}