中文

用于语音识别的基于声学与对抗监督的非配对语音增强

计算与语言 2018-12-26 v1 机器学习 声音 音频与语音处理

摘要

许多语音增强方法试图学习使用声学房间模拟器获得的带噪语音与干净语音之间的关系。我们指出依赖干净语音目标的增强方法的若干局限;本工作的目标是提出一种替代学习算法,称为声学与对抗监督(AAS)。AAS 使增强输出既在预训练声学模型上最大化转写似然,又具备干净语音的通用特征,从而改善对未见带噪语音的泛化能力。我们采用连接主义时序分类与未配对条件边界平衡生成对抗网络作为 AAS 的损失函数。AAS 在两个数据集上测试,包括无混响与有混响的加性噪声,即 Librispeech + DEMAND 与 CHiME-4。通过用不同损失组合可视化增强语音,我们展示了各监督的作用。在这两个数据集上,AAS 均取得了比其他使用干净语音目标的最先进(SOTA)方法更低的词错误率。

关键词

引用

@article{arxiv.1811.02182,
  title  = {Unpaired Speech Enhancement by Acoustic and Adversarial Supervision for Speech Recognition},
  author = {Geonmin Kim and Hwaran Lee and Bo-Kyeong Kim and Sang-Hoon Oh and Soo-Young Lee},
  journal= {arXiv preprint arXiv:1811.02182},
  year   = {2018}
}

备注

will be published in IEEE Signal Processing Letter