中文

使用联合变分自编码器改进远场语音识别

音频与语音处理 2022-04-26 v1 计算与语言 机器学习 声音

摘要

当源语音受噪声或房间脉冲响应(RIR)污染时,自动语音识别(ASR)系统性能显著下降。通常,在失配与匹配的场景训练与测试中均会应用语音增强。在匹配设定下,声学模型(AM)在去混响的远场特征上训练,而在失配设定下,AM 固定不变。近来,使用去噪自编码器(DA)将语音特征从远场映射到近讲已有探索。本文关注匹配场景训练,并表明所提基于联合 VAE 的映射相比 DA 取得了显著改进。具体而言,我们观察到词错误率(WER)相比基于 DA 的增强绝对提升 2.5%,相比直接在远场滤波器组特征上训练的 AM 绝对提升 3.96%。

关键词

引用

@article{arxiv.2204.11286,
  title  = {Improved far-field speech recognition using Joint Variational Autoencoder},
  author = {Shashi Kumar and Shakti P. Rath and Abhishek Pandey},
  journal= {arXiv preprint arXiv:2204.11286},
  year   = {2022}
}

备注

5 pages, 2 figures, 3 tables