SignMAE:面向手语识别的分段驱动自监督学习
计算机视觉与模式识别
2026-05-05 v1
摘要
细微的手部差异使得手语识别具有挑战性,而许多现有方法依赖于在通用动作数据集上预训练的编码器,难以捕捉此类细粒度线索。我们提出一种用于手语识别的自监督预训练方法,采用分段掩码以适应关键部位的存在与运动,而非将手部姿态视为静态视觉标记。基于掩码-重构目标的训练可改善细粒度手语表征学习。在 WLASL、NMFs-CSL 和 Slovo 数据集上,我们的编码器实现了最先进的性能,在更少的输入帧数和模态数下提升了逐实例和逐类别 Top-1 准确率。
引用
@article{arxiv.2605.02094,
title = {SignMAE: Segmentation-Driven Self-Supervised Learning for Sign Language Recognition},
author = {Kunyuan Xie and Zhixi Cai and Kalin Stefanov},
journal= {arXiv preprint arXiv:2605.02094},
year = {2026}
}
备注
Accepted by ICPR 2026