中文

基于姿态的手语检测:一种端到端编码器架构

计算机视觉与模式识别 2025-12-10 v1 计算与语言

摘要

自动手语识别(ASLR)已成为弥合聋人与听人之间差距的重要领域。然而,手语到手语检索或在一系列连续手语中检测特定手语的问题仍 largely unexplored。我们将此新任务定义为手语检测。在本文中,我们通过解决在句子级标注或手语视频中检测查询手语视频是否存在这一挑战,迈出了手语检索的第一步。与依赖中间标注识别或基于文本匹配的传统方法不同,我们提出了一种直接在手语视频提取的姿态关键点上运行的端到端模型。我们的架构采用仅编码器骨干网络和二分类头来判断查询手语是否出现在目标序列中。通过关注姿态表示而非原始RGB帧,我们的方法显著降低了计算成本并减轻了视觉噪声。我们在WSLP 2025共享任务的词存在预测数据集上评估了我们的方法,取得了61.88%的准确率和60.00%的F1分数。这些结果证明了我们的基于姿态的框架在手语检测中的有效性,为自动手语检索和验证的未来研究奠定了坚实基础。代码可在 https://github.com/EbimoJohnny/Pose-Based-Sign-Language-Spotting 获取。

关键词

引用

@article{arxiv.2512.08738,
  title  = {Pose-Based Sign Language Spotting via an End-to-End Encoder Architecture},
  author = {Samuel Ebimobowei Johnny and Blessed Guda and Emmanuel Enejo Aaron and Assane Gueye},
  journal= {arXiv preprint arXiv:2512.08738},
  year   = {2025}
}

备注

To appear at AACL-IJCNLP 2025 Workshop WSLP