用于流式语音识别的Transducer全局归一化
音频与语音处理
2023-07-21 v1 机器学习
声音
摘要
Transducer(如RNN-Transducer或Conformer-Transducer)在遍历输入序列时生成输出标签序列。它易于用于流式模式,在完整输入被看到之前生成部分假设。这使其在语音识别中很流行。然而,在流式模式下,Transducer存在一个数学缺陷,简言之,它限制了模型改变主意的能力。修复方法是将局部归一化(如softmax)替换为全局归一化,但随后损失函数变得无法精确计算。最近一篇论文提出通过近似模型来解决此问题,严重降低了性能。相反,本文提出近似损失函数,使全局归一化可应用于最先进的流式模型。全局归一化将其词错误率相对降低9-11%,几乎弥合了流式模式与前瞻模式之间一半的差距。
引用
@article{arxiv.2307.10975,
title = {Globally Normalising the Transducer for Streaming Speech Recognition},
author = {Rogier van Dalen},
journal= {arXiv preprint arXiv:2307.10975},
year = {2023}
}
备注
9 pages plus references and appendices