中文

TranSpeech:基于双边扰动的语音到语音翻译

计算与语言 2023-03-03 v2 声音 音频与语音处理

摘要

基于离散单元的直接语音到语音翻译(S2ST)利用了语音表征学习的最新进展。具体而言,模型预测以自监督方式导出的离散表征序列,并将其送入声码器以重建语音,但仍面临以下挑战:1)声学多模态性:具有相同内容的语音导出的离散单元可能因声学属性(如节奏、音高和能量)而不确定,导致翻译精度下降;2)高延迟:当前 S2ST 系统采用自回归模型,其基于先前生成的序列预测每个单元,未能充分利用并行性。本工作中,我们提出 TranSpeech,一种具有双边扰动的语音到语音翻译模型。为缓解声学多模态问题,我们提出双边扰动(BiP),其由风格归一化与信息增强两个阶段组成,以仅从语音样本中学习语言信息并生成更具确定性的表征。随着多模态性降低,我们进一步推进并成为首个建立非自回归 S2ST 技术的工作,该技术重复掩码并预测单元选择,仅在少数几轮内即可产生高精度结果。在三个语言对上的实验结果表明,与基线无文本 S2ST 模型相比,BiP 平均带来 2.9 BLEU 的提升。此外,我们的并行解码显示出推理延迟的显著下降,可实现相比自回归技术最高 21.4 倍的加速。音频样本见 \url{https://TranSpeech.github.io/}

关键词

引用

@article{arxiv.2205.12523,
  title  = {TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation},
  author = {Rongjie Huang and Jinglin Liu and Huadai Liu and Yi Ren and Lichao Zhang and Jinzheng He and Zhou Zhao},
  journal= {arXiv preprint arXiv:2205.12523},
  year   = {2023}
}

备注

Accpeted to ICLR 2023