面向鲁棒语音识别的流式模型与数据增强方法比较
音频与语音处理
2021-11-22 v1 声音
摘要
本文对两种不同在线流式语音识别模型:单调分块注意力(MoChA)与循环神经网络转导器(RNN-T)的鲁棒性进行了比较研究。我们探索了三种近期提出的数据增强技术,即使用声学模拟器的多条件训练、针对说话人变化的声道长度扰动(VTLP)以及SpecAugment。实验结果表明,单向模型通常对训练集中的噪声样本更为敏感。观察到模型的最终性能取决于经数据增强技术处理的训练样本比例。MoChA模型通常优于RNN-T模型。然而,我们观察到MoChA模型的训练似乎对训练集特性及额外增强技术的引入等多种因素更为敏感。另一方面,RNN-T模型在延迟、推理时间及训练稳定性方面表现优于MoChA模型。此外,RNN-T模型通常对噪声与混响更具鲁棒性。所有这些优势使得RNN-T模型相比MoChA模型成为流式设备端语音识别的更好选择。
引用
@article{arxiv.2111.10043,
title = {A comparison of streaming models and data augmentation methods for robust speech recognition},
author = {Jiyeon Kim and Mehul Kumar and Dhananjaya Gowda and Abhinav Garg and Chanwoo Kim},
journal= {arXiv preprint arXiv:2111.10043},
year = {2021}
}
备注
Accepted as a conference paper at ASRU 2021