利用伪标记数据改进直接语音到语音翻译
计算与语言
2022-05-19 v1 音频与语音处理
摘要
直接语音到语音翻译(S2ST)近年来受到越来越多的关注。由于数据稀缺和复杂的语音到语音映射,该任务极具挑战性。在本文中,我们报告了在 S2ST 方面的最新成果。首先,我们构建了一个 S2ST Transformer 基线,其性能优于原始的 Translatotron。其次,我们通过伪标记利用外部数据,在 Fisher 英到西测试集上取得了新的 SOTA 结果。实际上,我们将伪数据与一些流行技术结合使用,这些技术应用于 S2ST 时并非易事。此外,我们在句法相似(西班牙语-英语)和差异较大(英语-中文)的语言对上评估了我们的方法。我们的实现可在 https://github.com/fengpeng-yue/speech-to-speech-translation 获取。
引用
@article{arxiv.2205.08993,
title = {Leveraging Pseudo-labeled Data to Improve Direct Speech-to-Speech Translation},
author = {Qianqian Dong and Fengpeng Yue and Tom Ko and Mingxuan Wang and Qibing Bai and Yu Zhang},
journal= {arXiv preprint arXiv:2205.08993},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022