用于连续手语识别的签名者无关 Conformer 与多尺度融合 Transformer
计算机视觉与模式识别
2025-08-14 v1 人工智能
信息检索
机器学习
摘要
连续手语识别 (CSLR) 面临多重挑战,包括显著的签名者间差异以及对新颖句子结构的泛化能力差。传统解决方案通常无法有效处理这些问题。为克服这些限制,我们提出了一种双架构框架。针对签名者无关 (SI) 挑战,我们提出了一种签名者无关 Conformer,它将卷积与多头自注意力相结合,从基于姿态的骨骼关键点中学习鲁棒的、与签名者无关的特征表示。对于未见句子 (US) 任务,我们设计了一种带有新颖双路径时间编码器的多尺度融合 Transformer,能够捕捉细粒度的姿态动态,从而增强模型理解新颖语法组合的能力。在极具挑战性的 Isharah-1000 数据集上的实验为两个 CSLR 基准测试确立了新标准。所提出的 conformer 架构在 SI 挑战中实现了 13.07% 的词错误率 (WER),较现有技术降低了 13.53%。在 US 任务中,该 transformer 模型取得了 47.78% 的 WER,超越了以往工作。在 SignEval 2025 CSLR 挑战赛中,我们团队在 US 任务中荣获第 2 名,在 SI 任务中荣获第 4 名,证明了这些模型的性能。研究结果验证了我们的核心假设:针对 CSLR 的特定挑战开发专用网络可带来显著的性能提升,并为后续研究确立了新的基线。源代码可在以下地址获取:https://github.com/rezwanh001/MSLR-Pose86K-CSLR-Isharah。
引用
@article{arxiv.2508.09372,
title = {A Signer-Invariant Conformer and Multi-Scale Fusion Transformer for Continuous Sign Language Recognition},
author = {Md Rezwanul Haque and Md. Milon Islam and S M Taslim Uddin Raju and Fakhri Karray},
journal= {arXiv preprint arXiv:2508.09372},
year = {2025}
}
备注
Accepted for the IEEE/CVF International Conference on Computer Vision (ICCV), Honolulu, Hawaii, USA. 1st MSLR Workshop 2025