中文

基于离散单位和合成平行数据的改进型波斯语-英语语音到语音翻译

计算与语言 2025-11-18 v1 人工智能 机器学习

摘要

直接语音到语音翻译(S2ST)以端到端方式训练的所有组件,比级联系统更具吸引力,因为其管道更简单、推理延迟更低。然而,直接 S2ST 模型需要大量的源语言和目标语言平行语音数据,而波斯语等低资源语言几乎没有这些数据。本文提出了一个将波斯语语音翻译成英语语音的直接 S2ST 系统,以及用于生成合成平行波斯-英语语音的管道。该模型包含三个组件:(1)基于自监督预训练的 conformer 编码器,将源语音映射到高层声学表示;(2)带相对位置多头注意力的因果 transformer 解码器,将这些表示翻译为离散目标语音单位;(3)基于单元的神经声码器,从预测的离散单位生成波形。为缓解数据稀缺问题,我们构建了一个新的波斯-英语平行语音语料库,通过将波斯语语音转录翻译成英语,然后使用最先进的零样本文本到语音系统合成相应的英语语音。 resulting corpus increases the amount of available parallel speech by roughly a factor of six. 在波斯-英语 portion of the CVSS corpus 上,本文提出的模型相对于直接基线实现了 4.6 的 ASR BLEU 改进。这些结果表明,结合自监督预训练、离散语音单位和合成平行数据,对改进低资源语言对(如波斯-英语)的直接 S2ST 是有效的。

关键词

引用

@article{arxiv.2511.12690,
  title  = {Improving Direct Persian-English Speech-to-Speech Translation with Discrete Units and Synthetic Parallel Data},
  author = {Sina Rashidi and Hossein Sameti},
  journal= {arXiv preprint arXiv:2511.12690},
  year   = {2025}
}