中文

基于真实数据的无文本语音到语音翻译

计算与语言 2022-05-06 v2 人工智能 机器学习 音频与语音处理

摘要

我们提出了一种无文本语音到语音翻译(S2ST)系统,可将一种语言的语音翻译为另一种语言,且无需任何文本数据即可构建。与文献中现有工作不同,我们应对建模多说话人目标语音的挑战,并使用真实世界 S2ST 数据训练系统。我们方法的关键在于一种自监督的基于单元的语音归一化技术,其利用来自多说话人和单一参考说话人的配对音频微调预训练语音编码器,以减少口音带来的差异,同时保留词汇内容。仅用 10 分钟配对数据进行语音归一化,在 VoxPopuli S2ST 数据集上训练 S2ST 模型时,相较于在未归一化语音目标上训练的基线,我们平均获得 3.2 BLEU 增益。我们还引入了自动挖掘的 S2ST 数据并显示出额外的 2.0 BLEU 增益。据我们所知,我们是首个建立可基于真实世界数据训练且适用于多语言对的无文本 S2ST 技术。音频样本见 https://facebookresearch.github.io/speech_translation/textless_s2st_real_data/index.html 。

关键词

引用

@article{arxiv.2112.08352,
  title  = {Textless Speech-to-Speech Translation on Real Data},
  author = {Ann Lee and Hongyu Gong and Paul-Ambroise Duquenne and Holger Schwenk and Peng-Jen Chen and Changhan Wang and Sravya Popuri and Yossi Adi and Juan Pino and Jiatao Gu and Wei-Ning Hsu},
  journal= {arXiv preprint arXiv:2112.08352},
  year   = {2022}
}

备注

Accepted to NAACL 2022 (long paper)