高效 ASR 重打分的 Transformer 实证研究
计算与语言
2019-10-28 v1 音频与语音处理
摘要
神经语言模型(LM)已被证明在语言建模上显著优于经典 n-gram LM,因其具备建模文本中长期依赖和处理数据稀疏问题的更强能力。且近来,配置良好的深层 Transformer 在语言建模上展现出优于浅层循环神经网络堆叠的性能。然而,这些最先进的深层 Transformer 模型大多被设计为高容量的深层模型,这使其计算效率低,难以部署到大规模真实应用中。因此,开发具有相对较小模型规模、同时仍保留那些大得多模型良好性能的 Transformer LM 十分重要。本文旨在 ASR 重打分的背景下,对训练小参数规模的 Transformer 进行实证研究。通过结合子词单元、自适应 softmax、大规模模型预训练和知识蒸馏等技术,我们展示了能够通过 n-best 重打分以显著的相对词错率降低(WERR)成功训练小型 Transformer LM。特别地,我们在视频语音识别数据集上的实验表明,仅使用知名大型 GPT 模型 [1] 的 5.5% 至 11.9% 参数规模,即可取得 6.46% 到 7.17% 的 WERR,而该 GPT 模型在同一数据集上重打分的 WERR 为 7.58%。
引用
@article{arxiv.1910.11450,
title = {An Empirical Study of Efficient ASR Rescoring with Transformers},
author = {Hongzhao Huang and Fuchun Peng},
journal= {arXiv preprint arXiv:1910.11450},
year = {2019}
}
备注
5 pages, 5 tables