联合训练神经特征增强的流式端到端语音识别
声音
2021-05-05 v1 机器学习
音频与语音处理
摘要
在本文中,我们提出了一种基于单调分块注意力(MoCha)并与增强层联合训练的流式端到端语音识别模型。尽管MoCha注意力能够实现与基于全注意力方法识别精度相当的流式语音识别,但该模型的训练对训练样本难度、超参数等各种因素敏感。由于这些问题,当应用多风格训练方法时,MoCha基模型在干净语音上的语音识别精度显著下降。受课程学习[1]启发,我们引入了两种训练策略:增强特征的渐进应用(GAEF)和增强损失的渐进缩减(GREL)。通过GAEF,模型最初使用干净特征训练,随后来自增强层的输出比例逐渐增加。通过GREL,增强输出的均方误差(MSE)损失比例随训练进行逐渐减小。在LibriSpeech语料库和噪声远场测试集上的实验结果表明,采用GAEF-GREL训练策略的所提模型比传统的多风格训练方法表现出显著更好的结果。
引用
@article{arxiv.2105.01254,
title = {Streaming end-to-end speech recognition with jointly trained neural feature enhancement},
author = {Chanwoo Kim and Abhinav Garg and Dhananjaya Gowda and Seongkyu Mun and Changwoo Han},
journal= {arXiv preprint arXiv:2105.01254},
year = {2021}
}
备注
Accepted to ICASSP 2021