中文

带分段和姿态估计的孤立手语识别

计算机视觉与模式识别 2025-12-18 v1

摘要

近期大型语言模型的崛起自动化了 spoken 和 written 语言的翻译。然而,这些进展对于美国手语 (American Sign Language, ASL) 用户而言仍 largely 不可访问,其语言依赖于复杂的视觉线索。孤立手语识别 (Isolated Sign Language Recognition, ISLR) ——即对单个手语视频进行分类的任务——可帮助弥合这一差距,但目前受限于稀缺的 per-sign 数据、手语者的高变异性以及巨大的计算成本。我们提出了一个 ISLR 模型,在保持对手语者变异性鲁棒性的同时,降低了计算需求。我们的方案整合了 (i) 用于提取手部和面部关节点坐标的姿态估计管线,(ii) 隔离相关信息的分段模块,以及 (iii) 用于联合建模空间和时间依赖性的 ResNet-Transformer 主干网络。

关键词

引用

@article{arxiv.2512.14876,
  title  = {Isolated Sign Language Recognition with Segmentation and Pose Estimation},
  author = {Daniel Perkins and Davis Hunter and Dhrumil Patel and Galen Flanagan},
  journal= {arXiv preprint arXiv:2512.14876},
  year   = {2025}
}

备注

5 pages, 3 Figures