基于无监督预训练与自适应 Conformer 的连续手语识别
计算机视觉与模式识别
2024-05-21 v1
摘要
用于连续手语识别(CSLR)的传统深度学习框架由单模态或多模态特征提取器、序列学习模块和用于输出 glosses 的解码器组成。序列学习模块是关键部分,其中 Transformer 已证明其在序列到序列任务中的有效性。分析自然语言处理和语音识别领域的研究进展,可以看到各种 Transformer 变体的快速涌现。然而,在手语领域,对序列学习组件的实验仍然有限。在本研究中,将用于语音识别的 SOTA Conformer 模型适配于 CSLR,所提出的模型命名为 ConSignformer。这标志着首次将 Conformer 用于视觉任务。ConSignformer 具有双模态流水线,以 CNN 作为特征提取器,以 Conformer 进行序列学习。为了改进上下文学习,我们还引入了跨模态相对注意力(CMRA)。通过将 CMRA 引入模型,使其更善于学习和利用数据中的复杂关系。为了进一步增强 Conformer 模型,我们在精选的手语数据集上进行了名为回归特征提取的无监督预训练。随后对预训练的 Conformer 进行微调以用于下游识别任务。实验结果证实了所采用的预训练策略的有效性,并展示了 CMRA 如何促进识别过程。值得注意的是,借助基于 Conformer 的骨干网络,我们的模型在基准数据集 PHOENIX-2014 和 PHOENIX-2014T 上取得了 SOTA 性能。
引用
@article{arxiv.2405.12018,
title = {Continuous Sign Language Recognition with Adapted Conformer via Unsupervised Pretraining},
author = {Neena Aloysius and Geetha M and Prema Nedungadi},
journal= {arXiv preprint arXiv:2405.12018},
year = {2024}
}