利用语音翻译改进端到端语音识别的跨语言迁移学习
音频与语音处理
2020-10-12 v2 计算与语言
声音
摘要
从高资源语言进行迁移学习是改善低资源语言端到端自动语音识别(ASR)的有效方法。然而,预训练或联合训练的编码器-解码器模型并不共享同一语言的语言建模(解码器),这对于远距离目标语言可能效率低下。我们引入语音到文本翻译(ST)作为辅助任务,以融入目标语言的额外知识并实现从该目标语言迁移。具体而言,我们首先将高资源 ASR 转录文本翻译为目标低资源语言,并据此训练 ST 模型。ST 与目标 ASR 共享相同的基于注意力的编码器-解码器架构和词表。前一项任务随后为后一项任务提供完全预训练的模型,相较基线(从高资源 ASR 直接迁移)最高带来 24.6% 的词错误率(WER)降低。我们表明,使用人工翻译训练 ST 并非必要。用机器翻译(MT)伪标签训练的 ST 带来一致的增益。当仅利用 50 万 MT 样本迁移到目标 ASR 时,它甚至能优于使用人工标签的模型。即使使用来自低资源 MT 的伪标签(20 万样本),ST 增强的迁移相较直接迁移仍带来最高 8.9% 的 WER 降低。
引用
@article{arxiv.2006.05474,
title = {Improving Cross-Lingual Transfer Learning for End-to-End Speech Recognition with Speech Translation},
author = {Changhan Wang and Juan Pino and Jiatao Gu},
journal= {arXiv preprint arXiv:2006.05474},
year = {2020}
}
备注
Accepted to INTERSPEECH 2020