带分段和姿态估计的孤立手语识别
计算机视觉与模式识别
2025-12-18 v1
摘要
近期大型语言模型的崛起自动化了 spoken 和 written 语言的翻译。然而,这些进展对于美国手语 (American Sign Language, ASL) 用户而言仍 largely 不可访问,其语言依赖于复杂的视觉线索。孤立手语识别 (Isolated Sign Language Recognition, ISLR) ——即对单个手语视频进行分类的任务——可帮助弥合这一差距,但目前受限于稀缺的 per-sign 数据、手语者的高变异性以及巨大的计算成本。我们提出了一个 ISLR 模型,在保持对手语者变异性鲁棒性的同时,降低了计算需求。我们的方案整合了 (i) 用于提取手部和面部关节点坐标的姿态估计管线,(ii) 隔离相关信息的分段模块,以及 (iii) 用于联合建模空间和时间依赖性的 ResNet-Transformer 主干网络。
关键词
引用
@article{arxiv.2512.14876,
title = {Isolated Sign Language Recognition with Segmentation and Pose Estimation},
author = {Daniel Perkins and Davis Hunter and Dhrumil Patel and Galen Flanagan},
journal= {arXiv preprint arXiv:2512.14876},
year = {2025}
}
备注
5 pages, 3 Figures