DASpeech:用于快速高质量语音到语音翻译的有向无环Transformer
计算与语言
2023-10-12 v1 人工智能
声音
音频与语音处理
摘要
直接语音到语音翻译(S2ST)使用单一模型将一种语言的语音翻译为另一种语言的语音。然而,由于语言和声学多样性的存在,目标语音遵循复杂的多模态分布,给S2ST模型同时实现高质量翻译和快速解码速度带来挑战。本文提出DASpeech,一种非自回归直接S2ST模型,实现了快速且高质量的S2ST。为更好地捕捉目标语音的复杂分布,DASpeech采用两遍架构将生成过程分解为两步:语言解码器首先生成目标文本,随后声学解码器基于语言解码器的隐藏状态生成目标语音。具体而言,我们使用DA-Transformer的解码器作为语言解码器,并使用FastSpeech 2作为声学解码器。DA-Transformer以有向无环图(DAG)对翻译建模。为在训练期间考虑DAG中的所有潜在路径,我们通过动态规划计算每个目标词元的期望隐藏状态,并将其输入声学解码器以预测目标梅尔频谱图。推理时,我们选择最可能路径,并将该路径上的隐藏状态作为声学解码器的输入。在CVSS Fr-En基准上的实验表明,DASpeech能达到与最先进S2ST模型Translatotron 2相当甚至更优的性能,同时相比自回归基线最高保持18.53倍加速。与先前的非自回归S2ST模型相比,DASpeech不依赖知识蒸馏与迭代解码,在翻译质量和解码速度上均取得显著提升。此外,DASpeech展现出在翻译中保留源语音说话人声音的能力。
引用
@article{arxiv.2310.07403,
title = {DASpeech: Directed Acyclic Transformer for Fast and High-quality Speech-to-Speech Translation},
author = {Qingkai Fang and Yan Zhou and Yang Feng},
journal= {arXiv preprint arXiv:2310.07403},
year = {2023}
}
备注
NeurIPS 2023. Audio samples are available at https://ictnlp.github.io/daspeech-demo/