中文

直接语音到语音神经机器翻译:综述

计算与语言 2024-11-25 v1 声音 音频与语音处理

摘要

语音到语音翻译(S2ST)模型将一种语言的语音转换为另一种目标语言的语音,保留相同的语言信息。S2ST 对弥合社区之间的沟通鸿沟具有重要意义,并具有多样化的应用。近年来,研究者引入了直接 S2ST 模型,这些模型有望在无需依赖中间文本生成的情况下进行翻译,具有更好的解码延迟,以及保持副语言和非语言特征的能力。然而,直接 S2ST 尚未实现无缝沟通的质量性能,尤其在实际翻译场景中仍落后于级联模型。鉴于目前没有关于直接 S2ST 系统的综合性综述,供初学者和高级研究者快速了解。本文提供了关于直接 S2ST 模型、数据和应用问题、以及性能指标的全面回顾。我们对模型在基准数据集上的性能进行了批判性分析,并提供了研究挑战和未来方向。

关键词

引用

@article{arxiv.2411.14453,
  title  = {Direct Speech-to-Speech Neural Machine Translation: A Survey},
  author = {Mahendra Gupta and Maitreyee Dutta and Chandresh Kumar Maurya},
  journal= {arXiv preprint arXiv:2411.14453},
  year   = {2024}
}