中文

UnitY:基于离散单元的两遍直接语音到语音翻译

计算与语言 2023-05-29 v2 声音 音频与语音处理

摘要

直接语音到语音翻译(S2ST)的所有组件可联合优化,相较于级联方法能以简化流程实现快速推理。我们提出了一种新颖的两遍直接S2ST架构UnitY,其首先生成文本表示,随后预测离散声学单元。我们通过第一遍解码器中的子词预测、先进的双遍解码器架构设计与搜索策略以及更好的训练正则化来提升模型性能。为利用大量无标注文本数据,我们基于自监督去噪自编码任务预训练第一遍文本解码器。在各种数据规模的基准数据集上的实验评估表明,UnitY以2.83倍解码加速优于单遍语音到单元翻译模型2.5-4.2 ASR-BLEU。我们展示了即使第二遍预测谱图,所提方法也能提升性能。然而,预测离散单元相比该情况实现了2.51倍解码加速。

关键词

引用

@article{arxiv.2212.08055,
  title  = {UnitY: Two-pass Direct Speech-to-speech Translation with Discrete Units},
  author = {Hirofumi Inaguma and Sravya Popuri and Ilia Kulikov and Peng-Jen Chen and Changhan Wang and Yu-An Chung and Yun Tang and Ann Lee and Shinji Watanabe and Juan Pino},
  journal= {arXiv preprint arXiv:2212.08055},
  year   = {2023}
}

备注

ACL 2023 (main conference)