中文

基于骨架的手语识别:使用双流时空动态图卷积网络

计算机视觉与模式识别 2025-09-19 v2 人工智能

摘要

孤立手语识别(ISLR)面临形态相似但语义不同的手势问题,这一问题源于手型与运动轨迹之间复杂的相互作用。现有方法通常依赖单一参考帧,难以解决这种几何歧义。本文引入Dual-SignLanguageNet(DSLNet),一种双参考、双流架构,将手势形态和轨迹在各自互补的坐标系中进行解耦和建模。该架构通过专用网络处理这些流:拓扑感知图卷积网络从手腕中心坐标系中建模与观察无关的手型,而基于费斯特几何的编码器从面部中心坐标系中捕获情境感知的轨迹。这些特征通过几何驱动的最优传输融合机制进行整合。DSLNet 在 WLASL-100、WLASL-300 和 LSA64 数据集上分别实现了 93.70%、89.97% 和 99.79% 的准确率,参数数量显著低于竞争模型。

关键词

引用

@article{arxiv.2509.08661,
  title  = {Skeleton-based sign language recognition using a dual-stream spatio-temporal dynamic graph convolutional network},
  author = {Liangjin Liu and Haoyang Zheng and Zhengzhong Zhu and Pei Zhou},
  journal= {arXiv preprint arXiv:2509.08661},
  year   = {2025}
}

备注

5 pages, 3 figures