一种面向低资源端到端 ASR 的基于策略的 SpecAugment 方法
声音
2022-10-18 v1 音频与语音处理
摘要
SpecAugment 是一种对 HMM 和基于 E2E 的自动语音识别(ASR)系统都非常有效的数据增强方法。尤其它在低资源场景下也有效。然而,SpecAugment 以固定的增强策略对时域或频域频谱进行掩蔽,这可能给低资源 ASR 带来相对较少的数据多样性。在本文中,我们提出一种基于策略的 SpecAugment(Policy-SpecAugment)方法来缓解上述问题。其思想是采用增强选择策略和增强参数变化策略来解决固定方式。这些策略基于验证集损失学习,并应用于相应的增强策略。它旨在鼓励模型学习更多样化的、模型相对所需的数据。在实验中,我们在低资源场景下评估了方法的有效性,即 100 小时 librispeech 任务。根据结果与分析,我们可以看到上述问题利用我们的方案得到明显缓解。此外,实验结果表明,与最先进的 SpecAugment 相比,所提 Policy-SpecAugment 在 Test/Dev-clean 集上相对词错率(WER)降低超过 10%,在 Test/Dev-other 集上超过 5%,且在所有测试集上绝对 WER 降低超过 1%。
引用
@article{arxiv.2210.08520,
title = {A Policy-based Approach to the SpecAugment Method for Low Resource E2E ASR},
author = {Rui Li and Guodong Ma and Dexin Zhao and Ranran Zeng and Xiaoyu Li and Hao Huang},
journal= {arXiv preprint arXiv:2210.08520},
year = {2022}
}
备注
Accepted to APSIPA ASC 2022