中文

SSL-SLR:面向手语识别的自监督表示学习

计算机视觉与模式识别 2026-03-09 v2

摘要

手语识别(SLR)是一项旨在从视频中识别手语符号的机器学习任务。由于标注数据的稀缺,无监督方法如对比学习已成为该领域的前景方向。它们通过拉近正样本对(同一实例的两种增强版本)并推远负样本对(与正样本对不同)来学习有意义的表示。在 SLR 中,手语视频中只有某些部分包含对其识别真正有用的信息。将对比方法应用于 SLR 会引发两个问题:(i)对比学习方法以相同方式处理视频的所有部分,未考虑某些部分相对于其他部分的相关性;(ii)不同手语之间的共享动作使负样本对高度相似,增加了手语辨别的难度。这些问题导致学习到对手语识别不具有判别力的特征,并在下游任务中表现不佳。作为回应,本文提出了一种专为 SLR 学习有意义表示而设计的自监督学习框架。该框架由两个协同工作的关键组件组成:(i)一种带有自由负样本对的新自监督方法;(ii)一种新的数据增强技术。该方法在线性评估、半监督学习以及手语之间的迁移性方面,相比多种对比和自监督方法均展现了显著的准确率提升。

关键词

引用

@article{arxiv.2509.05188,
  title  = {SSL-SLR: Self-Supervised Representation Learning for Sign Language Recognition},
  author = {Ariel Basso Madjoukeng and Jérôme Fink and Pierre Poitier and Edith Belise Kenmogne and Benoit Frenay},
  journal= {arXiv preprint arXiv:2509.05188},
  year   = {2026}
}