中文

低资源条件下通过回译预训练实现端到端自动语音识别

音频与语音处理 2019-08-06 v2 计算与语言 声音

摘要

我们探索在低资源条件下训练基于注意力的编码器-解码器 ASR。这些模型在少量转写语音上训练时表现不佳,部分原因是它们依赖于具有充足目标端文本来训练注意力和解码器网络。本文中,我们仅使用基于文本的数据和其他语言的转写语音来预训练网络参数,以解决这一缺陷。我们分析了两类数据来源的相对贡献。在 3 种测试语言上,我们基于文本的方法相比无预训练的基于文本的增强技术带来了平均 20% 的相对提升。使用邻近语言的转写语音进一步带来了 20-30% 的相对字符错误率降低。

关键词

引用

@article{arxiv.1812.03919,
  title  = {Pretraining by Backtranslation for End-to-end ASR in Low-Resource Settings},
  author = {Matthew Wiesner and Adithya Renduchintala and Shinji Watanabe and Chunxi Liu and Najim Dehak and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:1812.03919},
  year   = {2019}
}