中文

Isharah:一个用于连续手语识别的大规模多场景数据集

计算机视觉与模式识别 2025-06-05 v1

摘要

当前手语识别(SLR)的基准主要聚焦于孤立SLR,而连续SLR(CSLR)的数据集较少,后者识别视频中的手语序列。此外,现有的CSLR数据集在受控环境中采集,这限制了其构建鲁棒的现实CSLR系统的有效性。为解决这些限制,我们提出了Isharah,一个用于CSLR的大规模多场景数据集。它是首个在该类型和规模上在不受约束环境中使用手语者的智能手机摄像头采集的数据集。这种设置导致录制设置、相机距离、角度和分辨率的高度变化。这种变化有助于开发能够处理现实场景多样性和复杂性的手语理解模型。该数据集包含由18位聋人和专业手语者执行的30,000个视频片段。此外,该数据集在语言学上丰富,为所有数据集视频提供gloss级标注,使其可用于开发CSLR和手语翻译(SLT)系统。本文还引入了多种手语理解基准,包括signer-independent和unseen-sentence CSLR,以及基于gloss和无gloss的SLT。Isharah数据集可在 https://snalyami.github.io/Isharah_CSLR/ 获取。

关键词

引用

@article{arxiv.2506.03615,
  title  = {Isharah: A Large-Scale Multi-Scene Dataset for Continuous Sign Language Recognition},
  author = {Sarah Alyami and Hamzah Luqman and Sadam Al-Azani and Maad Alowaifeer and Yazeed Alharbi and Yaser Alonaizan},
  journal= {arXiv preprint arXiv:2506.03615},
  year   = {2025}
}