利用有限并行数据的无文本语音到语音翻译
计算与语言
2024-11-08 v3 音频与语音处理
摘要
现有的语音到语音翻译(S2ST)模型分为两类:要么利用文本作为中间步骤,要么需要数百小时的并行语音数据。这两种方法都不适用于无文本语言或并行数据有限的语言对。我们提出 PFB,一种训练无文本 S2ST 模型的框架,其仅需数十小时的并行语音数据。我们首先在大规模单语语音数据上预训练模型,用少量并行语音数据(20–60 小时)微调,最后以无监督回译目标进行训练。我们在三个不同领域(欧洲议会、Common Voice 和全印广播电台)使用单说话人合成语音,训练并评估了英语到德语、德语到英语以及马拉地语到英语的模型。使用 ASR-BLEU 指标评估,我们的模型在所有三个领域均取得了合理性能,其中部分模型与我们使用更高资源的上限模型仅差 1–2 个点。
引用
@article{arxiv.2305.15405,
title = {Textless Speech-to-Speech Translation With Limited Parallel Data},
author = {Anuj Diwan and Anirudh Srinivasan and David Harwath and Eunsol Choi},
journal= {arXiv preprint arXiv:2305.15405},
year = {2024}
}
备注
Accepted to EMNLP 2024 Findings