基于堆叠 Transformer 的时空注意力模型用于动态手语与手指拼写识别
计算机视觉与模式识别
2025-11-11 v2
摘要
基于手势的手语识别(SLR)是听人与非听人之间沟通的重要桥梁。图卷积网络(GCN)虽被广泛使用,但其依赖于固定的骨骼图结构,存在一定局限。为克服这一局限,我们提出了序列时空注意力网络(SSTAN),一种新颖的基于 Transformer 的架构。该模型采用分层堆叠设计,依次整合空间多头注意力(MHA)以捕捉帧内关节关系,并整合时间多头注意力(MHA)以建模长程帧间依赖关系。这种方法使模型能够在无需预定义图结构的情况下高效学习复杂的时空模式。我们通过在多个大规模数据集(WLASL、JSL 和 KSL)上的大量实验验证了该模型。一个关键发现是,我们完全从零开始训练的模型在具有挑战性的手指拼写类别(JSL 和 KSL)中达到了当前最优(SOTA)性能。此外,该模型在 WLASL 上为仅使用骨骼数据的方法建立了新的 SOTA,优于多种依赖复杂自监督预训练的方法。这些结果表明,我们的模型具有较高的数据效率,并能够有效捕捉手语中复杂的动态特征。官方实现已发布在我们的 GitHub 代码仓库:\href{https://github.com/K-Hirooka-Aizu/skeleton-slr-transformer}{https://github.com/K-Hirooka-Aizu/skeleton-slr-transformer}。
引用
@article{arxiv.2503.16855,
title = {Stack Transformer Based Spatial-Temporal Attention Model for Dynamic Sign Language and Fingerspelling Recognition},
author = {Koki Hirooka and Abu Saleh Musa Miah and Tatsuya Murakami and Md. Al Mehedi Hasan and Yong Seok Hwang and Jungpil Shin},
journal= {arXiv preprint arXiv:2503.16855},
year = {2025}
}
备注
15 pages, 12 figures. Submitted to IEEE Access (under review)