中文

SignVTCL:视觉 - 文本对比学习增强的多模态连续手语识别

计算机视觉与模式识别 2024-01-23 v1

摘要

手语识别 (SLR) 在促进听障群体沟通方面发挥着至关重要的作用。SLR 是一项弱监督任务,其中整个视频都标注了手语 gloss,使得在视频片段中识别相应的手语 gloss 具有挑战性。最近的研究表明,SLR 的主要瓶颈是由于缺乏大规模数据集导致的训练不足。为应对这一挑战,我们提出了 SignVTCL,这是一个由视觉 - 文本对比学习增强的多模态连续手语识别框架,它利用了多模态数据的全部潜力和语言模型的泛化能力。SignVTCL 同时整合多模态数据(视频、关键点和光流)来训练统一的视觉骨干网络,从而产生更鲁棒的视觉表示。此外,SignVTCL 包含一种视觉 - 文本对齐方法,结合了 gloss 级别和句子级别的对齐,以确保在单个 gloss 和句子级别上视觉特征与 gloss 之间的精确对应。在 Phoenix-2014、Phoenix-2014T 和 CSL-Daily 三个数据集上进行的实验结果表明,与以往方法相比,SignVTCL 取得了最先进的结果。

关键词

引用

@article{arxiv.2401.11847,
  title  = {SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning},
  author = {Hao Chen and Jiaze Wang and Ziyu Guo and Jinpeng Li and Donghao Zhou and Bian Wu and Chenyong Guan and Guangyong Chen and Pheng-Ann Heng},
  journal= {arXiv preprint arXiv:2401.11847},
  year   = {2024}
}