中文

基于离散语音表征的无文本直接语音到语音翻译

计算与语言 2022-11-17 v1 声音 音频与语音处理

摘要

近年来,语音到语音翻译(S2ST)的研究进展迅速。许多端到端系统被提出,并展现出相对于通常由识别、翻译和合成子系统组成的传统级联系统的优势。然而,大多数端到端系统在训练时仍依赖中间文本监督,这使得它们无法用于没有书写形式的语言。在这项工作中,我们提出了一种基于 Translatotron 2 的新模型 Textless Translatotron,用于训练无需任何文本监督的端到端直接 S2ST 模型。与 Translatotron 2 中通过预测目标音素的辅助任务进行联合训练不同,所提模型使用预测离散语音表征的辅助任务,这些表征来自有监督学习或随机的语音量化器。当两种模型都使用基于无监督语音数据预训练的语音编码器时,所提模型在多语言 CVSS-C 语料库以及双语 Fisher 西班牙语-英语语料库上取得的翻译质量与 Translatotron 2 几乎持平。在后者上,它以 +18.5 BLEU 的优势超越了先前最先进的无文本模型。

关键词

引用

@article{arxiv.2211.00115,
  title  = {Textless Direct Speech-to-Speech Translation with Discrete Speech Representation},
  author = {Xinjian Li and Ye Jia and Chung-Cheng Chiu},
  journal= {arXiv preprint arXiv:2211.00115},
  year   = {2022}
}