中文

通过减少表示密度提高无 gloss 手语翻译性能

计算机视觉与模式识别 2024-10-30 v2 计算与语言 多媒体

摘要

无gloss手语翻译(Gloss-free SLT)旨在构建无需昂贵gloss标注的高性能SLT系统,但目前仍显著落后于基于gloss的方法。本文我们识别到一种表示密度问题,可能是限制Gloss-free方法性能的瓶颈。具体而言,表示密度问题指的是语义上不同的手势视觉表征在特征空间中倾向于紧密聚集,从而使Gloss-free方法难以区分不同手势,导致性能急剧下降。为此,我们引入一种简单而有效的对比学习策略,即SignCL,鼓励Gloss-free模型在自监督方式下学习更具辨识力的特征表征。我们的实验表明,所提出的SignCL可显著降低表示密度并在各种翻译框架中提升性能。具体而言,SignCL在Sign Language Transformer和GFSLT-VLP模型上分别在CSL-Daily数据集上实现了约39%和46%的BLEU分数提升,且无需增加模型参数。相较于基于大规模预训练视觉语言模型的方法Sign2GPT,SignCL仅需其35%的参数即可实现更好的性能。实现代码和模型检查点已公开于https://github.com/JinhuiYE/SignCL。

关键词

引用

@article{arxiv.2405.14312,
  title  = {Improving Gloss-free Sign Language Translation by Reducing Representation Density},
  author = {Jinhui Ye and Xing Wang and Wenxiang Jiao and Junwei Liang and Hui Xiong},
  journal= {arXiv preprint arXiv:2405.14312},
  year   = {2024}
}

备注

Accepted at NeurIPS'24; Representation Density Problem and Performance Drop in Gloss-free SLT