中文

无需并行语音数据能否实现高质量的直接语音到语音翻译?

计算与语言 2024-06-12 v1 人工智能 声音 音频与语音处理

摘要

最近提出的两遍直接语音到语音翻译(S2ST)模型将任务分解为端到端模型内的语音到文本翻译(S2TT)和文本到语音(TTS),取得了有希望的结果。然而,这些模型的训练仍然依赖于并行语音数据,而收集这些数据极具挑战性。相比之下,S2TT和TTS已经积累了大量的数据和预训练模型,这些在S2ST模型的开发中尚未得到充分利用。受此启发,在本文中,我们首先引入了一个名为ComSpeech的复合S2ST模型,它可以无缝地将任何预训练的S2TT和TTS模型集成到一个直接的S2ST模型中。此外,为了消除对并行语音数据的依赖,我们提出了一种新颖的训练方法ComSpeech-ZS,该方法仅利用S2TT和TTS数据。它通过对比学习在潜在空间中对齐表示,使得从TTS数据中学习到的语音合成能力能够以零样本的方式泛化到S2ST。在CVSS数据集上的实验结果表明,当并行语音数据可用时,ComSpeech在翻译质量和解码速度上都超过了之前的双通道模型,如UnitY和Translatotron 2。当没有并行语音数据时,ComSpeech-ZS仅落后于\name 0.7个ASR-BLEU值,并优于级联模型。

关键词

引用

@article{arxiv.2406.07289,
  title  = {Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?},
  author = {Qingkai Fang and Shaolei Zhang and Zhengrui Ma and Min Zhang and Yang Feng},
  journal= {arXiv preprint arXiv:2406.07289},
  year   = {2024}
}

备注

ACL 2024 main conference. Project Page: https://ictnlp.github.io/ComSpeech-Site/