中文

MASA:面向手语识别的 Motion-aware 掩码自编码器 with Semantic Alignment

计算机视觉与模式识别 2024-06-03 v1

摘要

手语识别 (SLR) 一直存在模型表示能力不足的难题。尽管当前的预训练方法通过在手语姿态数据上采用各种预文本任务来缓解这一困境并取得有希望的性能,但这些方法仍存在两个主要局限性:1) 以往的预文本任务通常忽略显式的运动信息,导致信息部分丢失且表示能力有限;2) 先前的方法仅关注手语姿态序列的局部上下文,未融合词汇手语的全局语义指导。为此,我们提出了一种集成丰富运动线索和全局语义信息的 Motion-Aware 掩码自编码器 with Semantic Alignment (MASA),用于 SLR 的自监督学习范式。我们的框架包含两个关键组件,即运动感知掩码自编码器 (MA) 和动量语义对齐模块 (SA)。具体而言,在 MA 中,我们引入一种带有运动感知掩码策略的自编码器架构,以重建被掩码帧的运动残差,从而显式地探索手语姿态序列中的动态运动线索。此外,在 SA 中,我们通过在共享潜在空间中对齐来自输入序列不同增强样本的嵌入,使框架具备全局语义意识。如此,我们的框架能够同时学习局部运动线索和全局语义特征,以实现全面的手语表示。进一步,我们在四个公开基准数据集上进行大量实验,以验证我们方法的有效性,实现了新的最佳性能。

关键词

引用

@article{arxiv.2405.20666,
  title  = {MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition},
  author = {Weichao Zhao and Hezhen Hu and Wengang Zhou and Yunyao Mao and Min Wang and Houqiang Li},
  journal= {arXiv preprint arXiv:2405.20666},
  year   = {2024}
}

备注

Accepted by TCSVT 2024