ISLR101:伊朗单词级手语识别数据集
计算机视觉与模式识别
2025-03-18 v1 人工智能
机器学习
摘要
手语识别涉及建模复杂的多通道信息,如手部姿态和动作,同时需要充足的手语专用数据。然而,手语往往资源匮乏,构成了该领域研究与开发的重大挑战。为此,我们引入ISLR101,这是首个公开的伊朗手语数据集,用于孤立手语识别。该数据集包含4614个视频,覆盖101个不同手语,由10名说话者录制(3名失语者、2名手语解释者和5名二语学习者),背景各异,分辨率为800x600像素,帧率为25帧/秒。数据集还包括使用OpenPose提取的骨架姿态信息。我们建立了基于视觉外观和基于骨架的框架作为基线模型,对其在ISLR101上的进行了全面训练和评估。这些模型在测试集上分别 achieves 97.01%和94.02%的准确率。此外,我们发布了训练、验证和测试划分,以促进公平比较。
引用
@article{arxiv.2503.12451,
title = {ISLR101: an Iranian Word-Level Sign Language Recognition Dataset},
author = {Hossein Ranjbar and Alireza Taheri},
journal= {arXiv preprint arXiv:2503.12451},
year = {2025}
}