中文

基于内-间gloss注意力的连续手语识别

计算机视觉与模式识别 2025-03-18 v1 人工智能

摘要

许多连续手语识别(CSLR)研究采用基于transformer的架构进行序列建模,因为它们具有捕获全局语境的强大能力。然而,作为transformer核心模块的普通自注意力机制会对所有时间步计算加权平均;因此,手语视频的局部时间语义可能未得到充分利用。在本研究中,我们引入了手语识别研究中的一个新模块,称为内-间gloss注意力模块,以利用gloss内帧之间的关系以及视频中gloss之间的语义和语法依赖。在gloss内注意力模块中,对视频进行等大小块的划分,并在每个块内应用自注意力机制。这种局部自注意力显著降低了复杂度,消除了考虑非相对帧所引入的噪声。在gloss间注意力模块中,我们首先通过在时间维度上进行平均池化来聚合每个gloss块内的块级特征。随后,对所有块级特征应用多头自注意力。鉴于签署者-环境交互的不重要性,我们利用分割来移除视频的背景。这使模型能够将注意力集中在签署者身上。在PHOENIX-2014基准数据集上的实验结果表明,我们的方法能够以无需任何先验知识的方式有效地从底部提取手语特征,提高了CSLR的准确率,在测试集上实现了20.4的词错误率(WER),这是与使用额外监督信息的最先进方法的竞争结果。

关键词

引用

@article{arxiv.2406.18333,
  title  = {Continuous Sign Language Recognition Using Intra-inter Gloss Attention},
  author = {Hossein Ranjbar and Alireza Taheri},
  journal= {arXiv preprint arXiv:2406.18333},
  year   = {2025}
}