中文

面向多对多多语种语音到语音翻译的无文本单元到单元训练

计算与语言 2024-08-20 v2 音频与语音处理 信号处理

摘要

本文提出一种用于多对多多语种语音到语音翻译的无文本训练方法,该方法还能有益于将预训练知识迁移到基于文本的系统、文本到语音合成以及文本到语音翻译。为此,我们用语音单元表示多语种语音,这些单元是来自自监督语音模型的语音特征离散化表征。通过将语音单元视为伪文本,我们可以专注于语音的语言内容,其能够在音素级信息上轻易地与语音和文本两种模态关联。通过将我们学习问题的输入和输出都设为语音单元,我们提出在多对多口语翻译设定下训练一个编码器-解码器模型,即单元到单元翻译(UTUT)。具体而言,编码器以源语言标记为条件以正确理解输入的口语语言,而解码器以目标语言标记为条件以生成目标语言的翻译语音。因此,在训练期间,模型可以构建关于语言如何被理解以及如何将其与不同语言相关联的知识。由于语音单元可通过量化和音素化分别从音频和文本轻易关联,即便以无文本方式训练,该训练好的模型也可轻松迁移到文本相关任务。我们证明所提出的 UTUT 模型不仅可有效用于语音到语音翻译(S2ST),还可用于多语种文本到语音合成(T2S)和文本到语音翻译(T2ST),仅需在文本输入上进行最少的微调步骤。通过开展涵盖多种语言的综合实验,我们验证了所提方法在不同多语种任务上的有效性。

关键词

引用

@article{arxiv.2308.01831,
  title  = {Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation},
  author = {Minsu Kim and Jeongsoo Choi and Dahun Kim and Yong Man Ro},
  journal= {arXiv preprint arXiv:2308.01831},
  year   = {2024}
}

备注

TASLP