面向真实世界无文字语言的语音到语音翻译
计算与语言
2022-11-17 v1 声音
音频与语音处理
摘要
我们研究语音到语音翻译(S2ST),即将一种语言的语音翻译为另一种语言的语音,并致力于构建支持无标准文字系统的语言之系统。我们以英语—台湾闽南语为例,给出从训练数据收集、建模选择到基准数据集发布的端到端方案。首先,我们呈现创建人工标注数据、从大型无标注语音数据集自动挖掘数据,以及采用伪标注生成弱监督数据的努力。在建模方面,我们利用近期将以自监督离散表示作为 S2ST 预测目标的研究进展,并展示在模型训练中借助与闽南语相近的 Mandarin 语的额外文本监督的有效性。最后,我们发布一个 S2ST 基准集以促进该领域未来研究。演示见 https://huggingface.co/spaces/facebook/Hokkien_Translation 。
引用
@article{arxiv.2211.06474,
title = {Speech-to-Speech Translation For A Real-world Unwritten Language},
author = {Peng-Jen Chen and Kevin Tran and Yilin Yang and Jingfei Du and Justine Kao and Yu-An Chung and Paden Tomasello and Paul-Ambroise Duquenne and Holger Schwenk and Hongyu Gong and Hirofumi Inaguma and Sravya Popuri and Changhan Wang and Juan Pino and Wei-Ning Hsu and Ann Lee},
journal= {arXiv preprint arXiv:2211.06474},
year = {2022}
}