TSLFormer:基于骨架关键点的轻量级变换器模型用于土耳其手势语言识别
计算与语言
2025-06-19 v4 图像与视频处理
摘要
本研究提出了 TSLFormer,一款轻便且稳健的土耳其手势语言(TSL)词级识别模型,将手势视为有序的、类似字符串的语言。本方法不使用原始 RGB 或深度视频,而是仅使用经 Google 的 Mediapipe 库提取的 3D 关节点位置——即手部和躯干的骨骼关键点。这样实现了输入维度的高效降低,同时保留了重要的语义手势信息。我们的做法受到手势语言语言本质及自然语言处理中变换器成功应用的启发,将手势识别重新定义为序列到序列翻译问题。由于 TSLFormer 使用自注意力机制,它能够有效捕获手势序列中的时序共现,并在词语展开的过程中凸显有意义的运动模式。在拥有超过 36,000 个样本和 227 个不同词语的 AUTSL 数据集上进行评估,TSLFormer 实现了与最小计算成本相当的竞争性能。这些结果表明,基于关节点的输入足以实现面向听力障碍者的实时、移动端和辅助性沟通系统。
引用
@article{arxiv.2505.07890,
title = {TSLFormer: A Lightweight Transformer Model for Turkish Sign Language Recognition Using Skeletal Landmarks},
author = {Kutay Ertürk and Furkan Altınışık and İrem Sarıaltın and Ömer Nezih Gerek},
journal= {arXiv preprint arXiv:2505.07890},
year = {2025}
}