用于连续孟加拉手语识别的词语级孟加拉手语数据集
计算机视觉与模式识别
2023-04-11 v2
摘要
一个鲁棒的手语识别系统可大幅缓解沟通障碍,尤其对于言语交流困难的人群。这对人类成长与进步至关重要,因其使思想、情感与观念的表达成为可能。然而,手语识别是一项复杂任务,面临诸多挑战,如多符号共用相同手势模式、光照、衣着、携带条件、大幅姿态的存在,以及不同视角下的光照差异。此外,缺乏大规模的孟加拉手语视频数据集使得运行识别系统更具挑战性,尤其在使用深度学习技术时。为解决此问题,我们首先创建了一个称为 MVBSL-W50 的大规模数据集,包含 13 个类别下的 50 个孤立词。其次,我们开发了一种基于注意力的 Bi-GRU 模型,用于捕捉手语交流者姿态信息的时间动态。所提模型利用人体姿态信息,已被证明在分析了手语模式方面取得成功。通过仅关注运动信息而忽略身体外观与环境因子,模型得以简化并可实现更快速的性能。报告模型准确率为 85.64%。
引用
@article{arxiv.2302.11559,
title = {Word level Bangla Sign Language Dataset for Continuous BSL Recognition},
author = {Md Shamimul Islam and A. J. M. Akhtarujjaman Joha and Md Nur Hossain and Sohaib Abdullah and Ibrahim Elwarfalli and Md Mahedi Hasan},
journal= {arXiv preprint arXiv:2302.11559},
year = {2023}
}