端到端神经自动语音识别模型的鲁棒性分析
计算与语言
2022-08-19 v1 机器学习
声音
音频与语音处理
摘要
我们研究用于自动语音识别的预训练神经模型的鲁棒性性质。机器学习中的真实数据通常非常嘈杂且几乎从不清净,这可归因于随领域而异的各类因素,例如离群值、随机噪声与对抗噪声。因此,我们为各类任务开发的模型应对此类噪声数据具有鲁棒性,这催生了鲁棒机器学习的兴盛领域。我们在自动语音识别设定下考量这一重要问题。随着预训练模型日益流行,分析并理解此类模型对噪声的鲁棒性成为重要课题。本工作中,我们对预训练神经模型 wav2vec2、HuBERT 与 DistilHuBERT 在 LibriSpeech 与 TIMIT 数据集上执行鲁棒性分析。我们使用不同加噪机制并度量由推理时间与标准词错误率(Word Error Rate)指标量化的模型表现。我们还对 wav2vec2 模型在层间注入噪声时进行深入的逐层分析,使我们能在较高层面预测各层所学内容。最后对该模型,我们可视化误差在各层间的传播,并比较其在干净与噪声数据下的行为。我们的实验印证了 Pasad 等人 [2021] 的预测,并提出了有趣的未来工作方向。
引用
@article{arxiv.2208.08509,
title = {Analyzing Robustness of End-to-End Neural Models for Automatic Speech Recognition},
author = {Goutham Rajendran and Wei Zou},
journal= {arXiv preprint arXiv:2208.08509},
year = {2022}
}
备注
5 pages, 14 figures