中文

探索机器语音链用于域自适应与少样本说话人自适应

计算与语言 2021-04-09 v1 声音 音频与语音处理

摘要

机器语音链将端到端(E2E)自动语音识别(ASR)与文本转语音(TTS)整合为一个闭环以进行联合训练,已被证明可通过利用大量无配对数据来有效进行数据增强。本文中,我们探索语音链中的 TTS->ASR 流水线,仅使用目标域的文本数据,对神经 TTS 与 E2E ASR 模型进行域自适应。我们从有声书域(LibriSpeech)向演讲域(TED-LIUM)自适应开展实验,在 TED-LIUM 测试集上 E2E ASR 模型的词错误率(WER)相对降低 10%,且演讲域中由神经 TTS 生成的合成语音 WER 相对降低 51.5%。进一步,我们以无监督方式利用目标说话人的少量语句对 E2E ASR 进行少样本说话人自适应,取得了额外增益。

关键词

引用

@article{arxiv.2104.03815,
  title  = {Exploring Machine Speech Chain for Domain Adaptation and Few-Shot Speaker Adaptation},
  author = {Fengpeng Yue and Yan Deng and Lei He and Tom Ko},
  journal= {arXiv preprint arXiv:2104.03815},
  year   = {2021}
}