中文

基于深度学习与MediaPipe Holistic的连续手语识别系统

机器学习 2024-11-08 v1 人工智能 计算机视觉与模式识别 多媒体

摘要

手语是听障人士使用手部、面部和身体动作进行交流的语言。不同的手势和动作代表字母、单词和短语。目前全球约有300种手语在使用,如美国手语(ASL)、中国手语(CSL)、印度手语(ISL)等。手语依赖于所在地的口语。与口语不同,手语中没有类似is、am、are、was、were、will、be等辅助词。由于只有有限人口精通手语,这种对手语的不熟悉阻碍了听障人士与所有人自由轻松地交流。这一问题可以通过手语识别(SLR)系统来解决,该系统能够将手语翻译成口语。在本文中,提出了一种使用深度学习模型(采用长短期记忆网络LSTM)的连续SLR系统,在印度手语(ISL)基础数据集上进行训练和测试。该数据集使用MediaPipe Holistic流水线进行面部、手部和身体动作追踪及关键点采集。该系统以88.23%的准确率实时识别手势和动作。

关键词

引用

@article{arxiv.2411.04517,
  title  = {Continuous Sign Language Recognition System using Deep Learning with MediaPipe Holistic},
  author = {Sharvani Srivastava and Sudhakar Singh and Pooja and Shiv Prakash},
  journal= {arXiv preprint arXiv:2411.04517},
  year   = {2024}
}

备注

14 pages, 4 figures, Wireless Pers Commun