中文

利用引导式GAN在失配环境下进行高效声学特征变换

声音 2022-10-07 v3 机器学习 音频与语音处理

摘要

我们提出一种新框架,利用作用于声学输入特征上的生成对抗网络(GAN)来改善资源稀缺环境下的自动语音识别(ASR)系统。该GAN用于在解码前增强失配数据的特征,或可选择用于微调声学模型。我们取得的改进可与多风格训练(MTR)相媲美,但计算成本更低。在少于一小时数据的情况下,一个在高质量数据上训练、并在失配音频上评估的ASR系统的相对词错误率(WER)降低了11.5%至19.7%。实验表明,该框架在训练数据与计算资源均受限的低资源环境下非常有用。该GAN不需要并行训练数据,因为它利用基线声学模型提供额外的损失项,引导生成器创建能被基线更好分类的声学特征。

关键词

引用

@article{arxiv.2210.00721,
  title  = {Efficient acoustic feature transformation in mismatched environments using a Guided-GAN},
  author = {Walter Heymans and Marelie H. Davel and Charl van Heerden},
  journal= {arXiv preprint arXiv:2210.00721},
  year   = {2022}
}

备注

Final published version available at: Efficient acoustic feature transformation in mismatched environments using a Guided-GAN. Speech Communication, 143, pp.10-20