基于语音与双语文本联合预训练的直接语音到语音翻译
声音
2022-11-01 v1 计算与语言
音频与语音处理
摘要
直接语音到语音翻译(S2ST)相比级联式 S2ST 具有诸多优势,是一个引人关注的研究方向。然而,由于从源语言语音到目标语言语音的语料极为稀少,直接 S2ST 面临数据稀缺问题。为解决该问题,本文提出 Speech2S 模型,该模型利用未配对的语音与双语文本数据联合预训练,用于直接语音到语音翻译任务。通过有效利用配对文本数据,Speech2S 能够对从源语言到目标语言的跨语言语音转换进行建模。我们在 Europarl-ST 和 VoxPopuli 数据集上验证了所提 Speech2S 的性能。实验结果表明,与仅编码器的预训练模型相比,Speech2S 的 BLEU 分数提升约 5 分,并取得了与现有最先进(state-of-the-art, SOTA)模型相当甚至更优的性能。
引用
@article{arxiv.2210.17027,
title = {Joint Pre-Training with Speech and Bilingual Text for Direct Speech to Speech Translation},
author = {Kun Wei and Long Zhou and Ziqiang Zhang and Liping Chen and Shujie Liu and Lei He and Jinyu Li and Furu Wei},
journal= {arXiv preprint arXiv:2210.17027},
year = {2022}
}
备注
Submitted to ICASSP 2023