使用联合变分自编码器改进远场语音识别
音频与语音处理
2022-04-26 v1 计算与语言
机器学习
声音
摘要
当源语音受噪声或房间脉冲响应(RIR)污染时,自动语音识别(ASR)系统性能显著下降。通常,在失配与匹配的场景训练与测试中均会应用语音增强。在匹配设定下,声学模型(AM)在去混响的远场特征上训练,而在失配设定下,AM 固定不变。近来,使用去噪自编码器(DA)将语音特征从远场映射到近讲已有探索。本文关注匹配场景训练,并表明所提基于联合 VAE 的映射相比 DA 取得了显著改进。具体而言,我们观察到词错误率(WER)相比基于 DA 的增强绝对提升 2.5%,相比直接在远场滤波器组特征上训练的 AM 绝对提升 3.96%。
引用
@article{arxiv.2204.11286,
title = {Improved far-field speech recognition using Joint Variational Autoencoder},
author = {Shashi Kumar and Shakti P. Rath and Abhishek Pandey},
journal= {arXiv preprint arXiv:2204.11286},
year = {2022}
}
备注
5 pages, 2 figures, 3 tables