中文

MM-WLAuslan:多视角多模态澳大利亚手语单词级数据集

计算机视觉与模式识别 2024-10-28 v1

摘要

孤立手语识别(ISLR)旨在识别单个手语词汇。鉴于不同地区手语的多样性,发展针对特定地区的 ISLR 数据集对于支持沟通和研究至关重要。作为澳大利亚特有的手语,Auslan 仍缺乏用于 ISLR 任务的大型单词级数据集。为填补这一空白,我们精心策划了首个大型多视角多模态单词级澳大利亚手语识别数据集,命名为 MM-WLAuslan。与其他公开数据集相比,MM-WLAuslan 具备三个显著优势:(1)数据量最大,(2)词汇量最广,(3)多模态摄像头视角最丰富。具体而言,我们记录了 282K 以上手势视频,涵盖 3,215 个常用 Auslan 词汇,由 73 位手语说话人在实验室环境中呈现。此外,我们的摄像系统包括两种不同类型的摄像头,即三个 Kinect-V2 摄像头和一个 RealSense 摄像头。我们将摄像头 hemispherically 布置在模型前半部分,并同时使用所有四个摄像头进行录制。此外,我们在 MM-WLAuslan 上对各种多模态 ISLR 设置(包括多视角、跨摄像头和跨视角)进行了基于最新方法的基准测试。实验结果表明,MM-WLAuslan 是一个具有挑战性的 ISLR 数据集,我们希望该数据集将推动澳大利亚手语及全球手语的发展。所有数据集和基准均可在 MM-WLAuslan 上获取。

关键词

引用

@article{arxiv.2410.19488,
  title  = {MM-WLAuslan: Multi-View Multi-Modal Word-Level Australian Sign Language Recognition Dataset},
  author = {Xin Shen and Heming Du and Hongwei Sheng and Shuyun Wang and Hui Chen and Huiqiang Chen and Zhuojie Wu and Xiaobiao Du and Jiaying Ying and Ruihan Lu and Qingzheng Xu and Xin Yu},
  journal= {arXiv preprint arXiv:2410.19488},
  year   = {2024}
}