基于自适应训练的流畅低延迟同声语音到语音翻译
计算与语言
2020-10-23 v2 人工智能
摘要
同声语音到语音翻译应用广泛但极具挑战,因其需在仅数秒延迟下,随源语言语音同步生成目标语言语音。此外,它需要连续翻译句子流,但近期所有方案仅关注单句场景。因此,当说话人语速较快时,当前方法会逐步累积延迟;而当说话人语速较慢时,会引入不自然的停顿。为克服这些问题,我们提出自适应翻译(SAT),其灵活调整翻译长度以适应不同的源语音速率。在相似的翻译质量水平下(以 BLEU 衡量),我们的方法在英汉互译两个方向上均生成了更流畅的目标语音(以自然度指标 MOS 衡量),且延迟显著低于基线。
引用
@article{arxiv.2010.10048,
title = {Fluent and Low-latency Simultaneous Speech-to-Speech Translation with Self-adaptive Training},
author = {Renjie Zheng and Mingbo Ma and Baigong Zheng and Kaibo Liu and Jiahong Yuan and Kenneth Church and Liang Huang},
journal= {arXiv preprint arXiv:2010.10048},
year = {2020}
}
备注
10 pages, accepted by Findings of EMNLP 2020