中文

分析低资源语音到文本翻译中的 ASR 预训练

计算与语言 2020-02-11 v2 音频与语音处理

摘要

先前工作表明,对于低资源源语言,自动语音到文本翻译(AST)可通过在高资源语言的自动语音识别(ASR)数据上预训练端到端模型而得到改进。然而,尚不清楚哪些因素——例如语言亲缘关系或预训练数据规模——带来最大改进,或者预训练是否能与数据增强等其他方法有效结合。在此,我们使用不同规模的预训练数据集进行实验,包括与 AST 源语言相关和不相关的语言。我们发现预训练 ASR 模型的最终 AST 性能的最佳预测指标是其词错误率(word error rate),且 ASR/AST 性能的差异与我们模型后期 RNN 层中语音信息编码方式相关。我们还表明预训练与数据增强对 AST 产生互补的益处。

关键词

引用

@article{arxiv.1910.10762,
  title  = {Analyzing ASR pretraining for low-resource speech-to-text translation},
  author = {Mihaela C. Stoian and Sameer Bansal and Sharon Goldwater},
  journal= {arXiv preprint arXiv:1910.10762},
  year   = {2020}
}

备注

Accepted at ICASSP 2020