中文

利用语音翻译改进端到端语音识别的跨语言迁移学习

音频与语音处理 2020-10-12 v2 计算与语言 声音

摘要

从高资源语言进行迁移学习是改善低资源语言端到端自动语音识别(ASR)的有效方法。然而,预训练或联合训练的编码器-解码器模型并不共享同一语言的语言建模(解码器),这对于远距离目标语言可能效率低下。我们引入语音到文本翻译(ST)作为辅助任务,以融入目标语言的额外知识并实现从该目标语言迁移。具体而言,我们首先将高资源 ASR 转录文本翻译为目标低资源语言,并据此训练 ST 模型。ST 与目标 ASR 共享相同的基于注意力的编码器-解码器架构和词表。前一项任务随后为后一项任务提供完全预训练的模型,相较基线(从高资源 ASR 直接迁移)最高带来 24.6% 的词错误率(WER)降低。我们表明,使用人工翻译训练 ST 并非必要。用机器翻译(MT)伪标签训练的 ST 带来一致的增益。当仅利用 50 万 MT 样本迁移到目标 ASR 时,它甚至能优于使用人工标签的模型。即使使用来自低资源 MT 的伪标签(20 万样本),ST 增强的迁移相较直接迁移仍带来最高 8.9% 的 WER 降低。

关键词

引用

@article{arxiv.2006.05474,
  title  = {Improving Cross-Lingual Transfer Learning for End-to-End Speech Recognition with Speech Translation},
  author = {Changhan Wang and Juan Pino and Jiatao Gu},
  journal= {arXiv preprint arXiv:2006.05474},
  year   = {2020}
}

备注

Accepted to INTERSPEECH 2020