面向自动语音识别的可学习特征提取正则化
音频与语音处理
2025-10-01 v2 计算与语言
机器学习
声音
摘要
神经前端作为传统固定特征提取管道的替代方案,因可直接针对声学模型进行训练而备受青睞。然而,其性能常常不足以媑美传统方法,我们证明这主要归因于其对过拟合的较大敏感性。因此,本文针对带可学习特征提取前端的ASR模型进行正则化方法的探讨。首先,我们检验了音频扰动方法,发现可学习特征可获得更大的相对改进。此外,我们识别了标准SpecAugment在这些前端中使用的两个局限性,并提出在短时傅里叶变换(STFT)域进行掩码——一种简单而有效的修改,以解决这些挑战。最后,通过整合这两种正则化方法,有效缩小了传统与可学习特征之间的性能差距。
关键词
引用
@article{arxiv.2506.09804,
title = {Regularizing Learnable Feature Extraction for Automatic Speech Recognition},
author = {Peter Vieting and Maximilian Kannen and Benedikt Hilmes and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:2506.09804},
year = {2025}
}
备注
Proceedings of Interspeech 2025