通过稀疏自注意力层将 RNN-Transducer 泛化到域外音频
音频与语音处理
2022-06-20 v2 人工智能
声音
摘要
循环神经网络转换器(RNN-T)是一种将输入声学帧转换为字符序列的端到端语音识别框架。目前最先进的 RNN-T 编码器网络是 Conformer,它可以通过其卷积和自注意力层有效地建模局部-全局上下文信息。尽管 Conformer RNN-T 已展现出卓越的性能,但大多数研究都是在训练和测试数据来自同一领域的设定下进行验证的。Conformer RNN-T 的领域不匹配问题尚未得到深入研究,而这对于产品级语音识别系统是一个重要问题。在本研究中,我们发现 Conformer 中的全连接自注意力层会导致高删除错误,尤其是在长格式域外话语中。为了解决这个问题,我们为基于 Conformer 的编码器网络引入了稀疏自注意力层,该层通过剪枝大部分域内拟合的全局连接,能够利用局部和泛化的全局信息。此外,我们还提出了一种用于预测网络泛化的状态重置方法,以应对长格式话语。将所提出的方法应用于域外测试,与基于全连接自注意力层的 Conformer 相比,我们获得了 27.6% 的相对字符错误率(CER)降低。
引用
@article{arxiv.2108.10752,
title = {Generalizing RNN-Transducer to Out-Domain Audio via Sparse Self-Attention Layers},
author = {Juntae Kim and Jeehye Lee},
journal= {arXiv preprint arXiv:2108.10752},
year = {2022}
}
备注
To be published in INTERSPEECH 2022