中文

利用伪标记数据改进直接语音到语音翻译

计算与语言 2022-05-19 v1 音频与语音处理

摘要

直接语音到语音翻译(S2ST)近年来受到越来越多的关注。由于数据稀缺和复杂的语音到语音映射,该任务极具挑战性。在本文中,我们报告了在 S2ST 方面的最新成果。首先,我们构建了一个 S2ST Transformer 基线,其性能优于原始的 Translatotron。其次,我们通过伪标记利用外部数据,在 Fisher 英到西测试集上取得了新的 SOTA 结果。实际上,我们将伪数据与一些流行技术结合使用,这些技术应用于 S2ST 时并非易事。此外,我们在句法相似(西班牙语-英语)和差异较大(英语-中文)的语言对上评估了我们的方法。我们的实现可在 https://github.com/fengpeng-yue/speech-to-speech-translation 获取。

关键词

引用

@article{arxiv.2205.08993,
  title  = {Leveraging Pseudo-labeled Data to Improve Direct Speech-to-Speech Translation},
  author = {Qianqian Dong and Fengpeng Yue and Tom Ko and Mingxuan Wang and Qibing Bai and Yu Zhang},
  journal= {arXiv preprint arXiv:2205.08993},
  year   = {2022}
}

备注

Submitted to INTERSPEECH 2022