打破障碍:面向词级手语识别的视频视觉 Transformer
计算机视觉与模式识别
2025-04-14 v2
摘要
手语是 deaf 和 hard-of-hearing(DHH)群体的基本交流方式,能够通过手势、面部表情和身体动作实现细腻表达。尽管其在促进 DHH 人群内交流中发挥着关键作用,但由于听力人群对手语的熟练程度有限,这些交流仍面临显著障碍。通过自动手语识别(SLR)来克服这一沟通鸿沟仍是挑战,尤其是在动态词级,必须有效识别时间和空间依赖性。虽然卷积神经网络(CNN)在 SLR 中显示出潜力,但计算密集且难以捕获视频序列之间的全局时间依赖性。为此,我们提出了用于词级美国手语(ASL)识别的视频视觉 Transformer(ViViT)模型。Transformer 模型利用自注意力机制有效捕获空间和时间维度之间的全局关系,适用于复杂手势识别任务。VideoMAE 模型在 WLASL100 数据集上实现了 75.58% 的 Top-1 准确率,显著优于传统 CNN 的 65.89%。我们的研究表明,基于 Transformer 的架构在推进 SLR、克服沟通障碍和促进 DHHH 人群融入方面具有巨大潜力。
引用
@article{arxiv.2504.07792,
title = {Breaking the Barriers: Video Vision Transformers for Word-Level Sign Language Recognition},
author = {Alexander Brettmann and Jakob Grävinghoff and Marlene Rüschoff and Marie Westhues},
journal= {arXiv preprint arXiv:2504.07792},
year = {2025}
}