中文

无监督手语翻译与生成

计算与语言 2024-02-13 v1

摘要

受无监督神经机器翻译(UNMT)成功的启发,我们引入了一种无监督手语翻译与生成网络(USLNet),该网络无需平行手语数据,仅从丰富的单模态(文本和视频)数据中学习。USLNet 包含两个主要组件:单模态重建模块(文本和视频),用于从同一模态的噪声版本重建输入;以及跨模态回译模块(文本 - 视频 - 文本和视频 - 文本 - 视频),利用回译过程从不同模态的噪声版本重建输入。与基于文本的 UNMT 中的单模态回译过程不同,USLNet 面临特征表示中的跨模态差异问题,即文本序列与视频序列在长度和特征维度上不匹配。我们提出了一种滑动窗口方法来解决可变长度文本与视频序列对齐的问题。据我们所知,USLNet 是首个能够以统一方式生成自然语言文本和手语视频的无监督手语翻译与生成模型。在 BBC-Oxford 手语数据集(BOBSL)和开放域美国手语数据集(OpenASL)上的实验结果表明,USLNet 取得了与有监督基线模型相当的结果,表明其在手语翻译和生成方面的有效性。

关键词

引用

@article{arxiv.2402.07726,
  title  = {Unsupervised Sign Language Translation and Generation},
  author = {Zhengsheng Guo and Zhiwei He and Wenxiang Jiao and Xing Wang and Rui Wang and Kehai Chen and Zhaopeng Tu and Yong Xu and Min Zhang},
  journal= {arXiv preprint arXiv:2402.07726},
  year   = {2024}
}