基于少样本原型网络的数据高效美式手语识别
计算机视觉与模式识别
2025-12-12 v1
摘要
孤立手语识别(ISLR)是连接听障或失声残障者与听众世界的关键技术,但其发展受限于数据稀缺和手语词汇的长尾分布,收集数千个独特手势的充足样本代价高昂。传统分类方法在此条件下常过拟合频繁类别,难以泛化至稀有类别。为克服此瓶颈,我们提出一种针对基于骨骼的编码器的少样本原型网络框架。不同于学习固定决策边界的传统分类器, our 方法采用 episodes 训练方式,在语义度量空间中学习,依据手势与动态类原型的接近程度进行分类。我们将时空图卷积网络(ST-GCN)与一种新颖的多尺度时序聚合(MSTA)模块集成,以捕获快速与流畅的运动动力学。在 WLASL 数据集上的实验结果表明,此度量学习范式优于共享相同背bone 架构的标准分类基线,Top-1 准确率提升 43.75%,Top-5 准确率提升 77.10%,尤其在数据稀缺情境下显著优于 13%。此外,模型在无需微调的情况下,即可在未见的 SignASL 数据集上实现近 30% 的零样本泛化,为利用有限数据识别大规模手语词汇提供了可扩展路径。
引用
@article{arxiv.2512.10562,
title = {Data-Efficient American Sign Language Recognition via Few-Shot Prototypical Networks},
author = {Meher Md Saad},
journal= {arXiv preprint arXiv:2512.10562},
year = {2025}
}