少即是多:利用有限标签上下文与路径合并改进RNN-T解码
计算与语言
2020-12-15 v1 机器学习
声音
音频与语音处理
摘要
将输出标签序列以所有先前预测标签为条件的端到端模型,已成为传统自动语音识别 (ASR) 系统的流行替代方案。由于唯一的标签历史对应于不同的模型状态,此类模型使用一种近似的集束搜索过程进行解码,该过程产生一棵假设树。本文中,我们研究了标签上下文数量对模型准确率的影响,及其对解码过程效率的作用。我们发现,在训练时将循环神经网络 transducer (RNN-T) 的上下文限制为仅四个先前的 word-piece 标签,相对于全上下文基线不会使词错误率 (WER) 退化。限制上下文也为提升解码时集束搜索过程的效率提供了机会,即从活跃集束中移除冗余路径,转而将其保留在最终词格中。这种路径合并方案也可通过一种近似应用于解码基线全上下文模型。总体而言,我们发现所提出的路径合并方案极为有效,使我们能够将 oracle WER 较基线提升至多 36%,同时在不造成任何 WER 退化的前提下将模型评估次数减少至多 5.3%。
引用
@article{arxiv.2012.06749,
title = {Less Is More: Improved RNN-T Decoding Using Limited Label Context and Path Merging},
author = {Rohit Prabhavalkar and Yanzhang He and David Rybach and Sean Campbell and Arun Narayanan and Trevor Strohman and Tara N. Sainath},
journal= {arXiv preprint arXiv:2012.06749},
year = {2020}
}