面向骨架感知手语识别的动态时空聚合
计算机视觉与模式识别
2024-03-20 v1
摘要
骨架感知手语识别(SLR)因其不受背景信息影响且计算需求较低而受到欢迎。当前方法分别利用空间图模块和时间模块来捕获空间和时间特征。然而,它们的空间图模块通常建立在固定图结构上,如图卷积网络或单一可学习图,这仅能部分探索关节关系。此外,使用简单的时间卷积核来捕获时间信息,可能无法完全捕获不同手语者的复杂运动模式。为克服这些局限,我们提出了一种新的空间架构,由两个并行分支组成,分别构建对输入敏感的关节关系并融入特定领域知识用于识别。这两个分支之后是一个聚合过程,以区分重要的关节连接。接着,我们提出一个新的时间模块来建模多尺度时间信息,以捕获复杂的人体动态。在四个大规模SLR基准上,我们的方法相比以往骨架感知方法达到了最先进的准确率。此外,在大多数情况下,我们的方法相比基于RGB的方法展现出更高的准确率,同时所需计算资源少得多,带来了更好的准确率-计算权衡。代码可在https://github.com/hulianyuyy/DSTA-SLR获取。
引用
@article{arxiv.2403.12519,
title = {Dynamic Spatial-Temporal Aggregation for Skeleton-Aware Sign Language Recognition},
author = {Lianyu Hu and Liqing Gao and Zekang Liu and Wei Feng},
journal= {arXiv preprint arXiv:2403.12519},
year = {2024}
}