中文

SignCLIP:通过对比学习连接文本与手语

计算与语言 2024-10-08 v2

摘要

我们提出SignCLIP,该方法将CLIP(Contrastive Language-Image Pretraining)重新用于将口语文本和手语视频这两类模态差异显著的自然语言投影到同一空间中。SignCLIP是一种高效的方法,可从大规模多语言视频文本对中学习有用的视觉表示,用于手语处理,而无需针对特定任务或手语(规模往往有限)进行直接优化。我们在包含约50万个视频剪辑的SignLanguage dictionary Spreadthesign上预训练SignCLIP,并在各种下游数据集上进行评估。SignCLIP在文本到视频/视频到文本检索中对同域手语识别准确率显著。它还在少量样本提示或微调的情况下,对如孤立手语识别等跨域下游任务表现竞争。我们分析了口语文本与手语姿态形成的潜在空间,这提供了额外的语言见解。我们的代码和模型已公开。

关键词

引用

@article{arxiv.2407.01264,
  title  = {SignCLIP: Connecting Text and Sign Language by Contrastive Learning},
  author = {Zifan Jiang and Gerard Sant and Amit Moryossef and Mathias Müller and Rico Sennrich and Sarah Ebling},
  journal= {arXiv preprint arXiv:2407.01264},
  year   = {2024}
}

备注

Accepted at EMNLP 2024 (Main)