在高资源语音识别上预训练可改善低资源语音到文本翻译
计算与语言
2019-03-01 v2
摘要
我们提出一种简单方法,在源语言为低资源时改善直接语音到文本翻译(ST):我们在高资源自动语音识别(ASR)任务上预训练模型,随后对其参数进行 ST 微调。我们证明该方法有效:在 300 小时英语 ASR 数据上预训练,当仅有 20 小时西班牙语-英语 ST 训练数据可用时,将西班牙语-英语 ST 的 BLEU 从 10.8 提升至 20.2。通过消融研究,我们发现预训练的编码器(声学模型)贡献了大部分提升,尽管这些任务中共享的语言是目标语言文本而非源语言音频。应用此洞见,我们展示即便 ASR 语言不同于 ST 的源语言与目标语言,ASR 预训练仍有助于 ST:在法语 ASR 上预训练同样改善西班牙语-英语 ST。最后,我们展示该方法在真实低资源任务上提升性能:在英语 ASR 与法语 ASR 组合上预训练,将仅含 4 小时数据的 Mboshi-法语 ST 的 BLEU 从 3.5 提升至 7.1。
引用
@article{arxiv.1809.01431,
title = {Pre-training on high-resource speech recognition improves low-resource speech-to-text translation},
author = {Sameer Bansal and Herman Kamper and Karen Livescu and Adam Lopez and Sharon Goldwater},
journal= {arXiv preprint arXiv:1809.01431},
year = {2019}
}
备注
Accepted for publication in NAACL 2019