Siformer:用于高效骨架基签名语言识别的特征隔离 Transformer
计算机视觉与模式识别
2025-03-27 v1
摘要
签名语言识别(SLR)指从给定视频中自动解释签名语言 glosses。该研究领域因签名语言中所包含的手势、身体姿势乃至面部表情等快速而复杂的运动而呈现复杂挑战。最近,由于其能够独立处理主体和背景变化,骨架基动作识别受到越来越多的关注。然而,当前的骨架基 SLR 方法存在三个局限性:1) 它们常常忽视真实手姿势的重要性,其中大多数研究是在非真实骨架表示上训练 SLR 模型;2) 它们倾向于假设在训练或推理阶段数据完全可用,并捕捉不同身体部位之间的复杂关系;3) 这些方法对所有签名 glosses 一致对待,未能考虑到关于骨架表示复杂度水平的差异。为了增强手部骨架表示的真实性,我们提出了一种运动学手姿势矫正方法,用于强制约束。为了减轻缺失数据的影响,我们提出了特征隔离机制以聚焦于捕捉局部时空上下文。该方法同时且独立地从各个特征中捕捉上下文,从而增强了 SLR 模型的鲁棒性。此外,为了适应不同签名 glosses 的复杂度水平,我们开发了一种输入自适应推理方法以优化计算效率和准确性。实验结果表明,我们的方法有效,证明在 WLASL100 和 LSA64 上实现了新的最先进(SOTA)性能。对于 WLASL100,我们以 86.50% 的 top-1 准确率实现了相对提升 2.39%。对于 LSA64,我们以 99.84% 的 top-1 准确率实现了。
引用
@article{arxiv.2503.20436,
title = {Siformer: Feature-isolated Transformer for Efficient Skeleton-based Sign Language Recognition},
author = {Muxin Pu and Mei Kuan Lim and Chun Yong Chong},
journal= {arXiv preprint arXiv:2503.20436},
year = {2025}
}
备注
10 pages, ACM Multimedia