中文

面向巴尔贝尔手语的视频 Transformer 精调:分类任务的比较分析

计算机视觉与模式识别 2025-06-06 v1

摘要

手语识别(SLR)涉及从图像或视频中自动识别手势并将其转换为文本或语音,以改善聋人社区的可访问性。在孟加拉国,巴尔贝尔手语(BdSL)是许多听力障碍者的主要交流方式。本研究对VideoMAE、ViViT和TimeSformer等最新视频变换器架构在BdSLW60(arXiv:2402.08635)上的进行精调,该数据集包含60个常见手势。我们将视频标准化为30 FPS,最终得到9,307段用户试验片段。为评估可扩展性和鲁棒性,这些模型也在BdSLW401(arXiv:2503.02360)上进行精调,该数据集包含401个手势类别。此外,我们还对比基准数据集,包括LSA64和WLASL。应用数据增强技术,如随机裁剪、水平翻转和短边缩放,以提高模型鲁棒性。为确保模型选择期间在不同折叠上的均衡评估,我们在训练集上采用10折分层交叉验证,同时使用来自不可见用户 U4 和 U8 的保留测试数据进行用户独立评估。结果显示,视频变换器模型显著优于传统机器学习和深度学习方法。性能受数据集大小、视频质量、帧分布、帧率和模型架构等因素影响。其中,VideoMAE 变体(MCG-NJU/videomae-base-finetuned-kinetics)在纠正帧率后的BdSLW60数据集上取得最高的95.5%准确率,在BdSLW401的正面手势上达到81.04%准确率,显示出强大的可扩展和准确的BdSL识别潜力。

关键词

引用

@article{arxiv.2506.04367,
  title  = {Fine-Tuning Video Transformers for Word-Level Bangla Sign Language: A Comparative Analysis for Classification Tasks},
  author = {Jubayer Ahmed Bhuiyan Shawon and Hasan Mahmud and Kamrul Hasan},
  journal= {arXiv preprint arXiv:2506.04367},
  year   = {2025}
}

备注

16 pages, 8 figures, 6 tables