中文

SignBERT+:面向手语理解的手部模型感知自监督预训练

计算机视觉与模式识别 2023-05-09 v1

摘要

手部姿态在手语表达中起着关键作用。当前基于深度学习的手语理解(SLU)方法因手语数据资源不足而易过拟合,且可解释性有限。本文提出首个融入模型感知手部先验的可自监督预训练SignBERT+框架。该框架中,手部姿态被视为视觉 token,由现成检测器得出。每个视觉 token 嵌入手势状态与时空位置编码。为充分利用当前手语数据资源,我们首先进行自监督学习以建模其统计特性;为此设计多级掩码建模策略(关节、帧与片段)以模拟常见检测失败情形。结合这些掩码建模策略,我们融入模型感知手部先验以更好地捕获序列上的层次化上下文。预训练后,我们精心设计了简洁而有效的预测头用于下游任务。为验证框架有效性,我们在三类主要SLU任务上进行了充分实验,涵盖孤立与连续手语识别(SLR)及手语翻译(SLT)。实验结果证明了方法的有效性,以显著增益取得了新的最先进性能。

关键词

引用

@article{arxiv.2305.04868,
  title  = {SignBERT+: Hand-model-aware Self-supervised Pre-training for Sign Language Understanding},
  author = {Hezhen Hu and Weichao Zhao and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2305.04868},
  year   = {2023}
}

备注

Accepted to TPAMI. Project Page: https://signbert-zoo.github.io/