中文

一种用于手语翻译的简单多模态迁移学习基线

计算机视觉与模式识别 2023-03-24 v2

摘要

本文提出了一种用于手语翻译的简单迁移学习基线。现有的手语数据集(如 PHOENIX-2014T、CSL-Daily)仅包含约 10K-20K 对手语视频、词格注释与文本,其规模比典型的口语翻译模型训练平行数据小一个数量级。因此,数据是训练有效手语翻译模型的瓶颈。为缓解该问题,我们提出从包含大量外部监督的通用领域数据集到领域内数据集逐步预训练模型。具体而言,我们在人类动作的通用领域和手语到词格(sign-to-gloss)数据集的领域内预训练手语到词格的视觉网络,并在多语言语料的通用领域和词格到文本语料的领域内预训练词格到文本的翻译网络。该联合模型通过一个名为视觉-语言映射器(visual-language mapper)的附加模块连接两个网络进行微调。这一简单基线在两个手语翻译基准上超越了以往的 SOTA 结果,证明了迁移学习的有效性。凭借其简洁性与强劲性能,该方法可作为未来研究的坚实基线。代码与模型见:https://github.com/FangyunWei/SLRT。

关键词

引用

@article{arxiv.2203.04287,
  title  = {A Simple Multi-Modality Transfer Learning Baseline for Sign Language Translation},
  author = {Yutong Chen and Fangyun Wei and Xiao Sun and Zhirong Wu and Stephen Lin},
  journal= {arXiv preprint arXiv:2203.04287},
  year   = {2023}
}

备注

Accepted by CVPR 2022. Code and models are available at: https://github.com/FangyunWei/SLRT