中文

孤立手语识别的训练策略

计算机视觉与模式识别 2025-05-14 v2

摘要

准确识别和解释手语对于增强聋人和听力障碍人士的沟通可及性至关重要。然而,当前的孤立手语识别(ISLR)方法常常面临数据质量低和手势速度变化等挑战。本文介绍了一种针对ISLR的全面模型训练流程,旨在适应手语领域的独特特征和约束。构建的流程包含了精心选择的图像和视频增强,以应对低数据质量和不同手语速度的挑战。加入额外的回归头结合IoU平衡分类损失,增强了模型对手势的感知,并简化了时间信息的捕获。大量实验表明,所开发的训练流程易于适应不同的数据集和架构。此外,消融研究表明,每个提出的组件都扩展了考虑ISLR任务特定性的潜力。所提出的策略在各种ISLR基准上提升了识别性能,并在WLASL和Slovo数据集上取得了最先进的结果。

关键词

引用

@article{arxiv.2412.11553,
  title  = {Training Strategies for Isolated Sign Language Recognition},
  author = {Karina Kvanchiani and Roman Kraynov and Elizaveta Petrova and Petr Surovcev and Aleksandr Nagaev and Alexander Kapitanov},
  journal= {arXiv preprint arXiv:2412.11553},
  year   = {2025}
}

备注

sign language recognition, training strategies, computer vision, isolated sign language recognition