基于频谱修正的数据增强以改善儿童语音端到端 ASR
音频与语音处理
2022-03-15 v1 信号处理
摘要
由于儿童与成人语音在声学属性上的固有差异以及公开儿童语音数据集的匮乏,训练一个鲁棒的用于儿童语音识别的自动语音识别(ASR)系统是一项具有挑战性的任务。本文引入了一种新颖的段级频谱扭曲与共振峰能量扰动方法,以从成人语音频谱生成类儿童的语音频谱。随后,该修正后的成人频谱被用作增强数据,以改善用于儿童语音识别的端到端 ASR 系统。与在 Librispeech 100 小时成人语音数据集上训练的声道长度扰动(VTLP)基线系统相比,所提数据增强方法在儿童开发集与测试集上分别带来了 6.5% 和 6.1% 的 WER 相对降低。当在训练中加入儿童语音数据与 Librispeech 集合时,与 VTLP 基线系统相比,分别带来了 3.7% 和 5.1% 的 WER 相对降低。
引用
@article{arxiv.2203.06600,
title = {Spectral Modification Based Data Augmentation For Improving End-to-End ASR For Children's Speech},
author = {Vishwanath Pratap Singh and Hardik Sailor and Supratik Bhattacharya and Abhishek Pandey},
journal= {arXiv preprint arXiv:2203.06600},
year = {2022}
}