NIESR:抗 nuisance 不变端到端语音识别
计算与语言
2019-07-09 v1 声音
音频与语音处理
摘要
用于语音识别的深度神经网络模型近来取得了巨大成功,但它们可能学到目标与语音的 nuisance 因素(例如说话人身份、背景噪声等)之间的错误关联,从而导致过拟合。虽然已提出若干方法来解决该问题,现有方法在训练时引入关于 nuisance 因素的额外信息以开发不变模型。然而,枚举语音数据中所有可能的 nuisance 因素并收集其标注是困难且昂贵的。我们提出了一种用于端到端语音识别的鲁棒训练方案,采用无监督对抗不变性诱导框架,在无需除转录文本外的任何补充标签的情况下,将语音识别的本质因素与 nuisance 因素分离。实验表明,采用所提训练方案训练的语音识别模型在 WSJ0 上相对提升 5.48%、在 CHiME3 上相对提升 6.16%、在 TIMIT 数据集上相对提升 6.61%。此外,所提方法在 WSJ0+CHiME3 合并数据集上取得了 14.44% 的相对提升。
引用
@article{arxiv.1907.03233,
title = {NIESR: Nuisance Invariant End-to-end Speech Recognition},
author = {I-Hung Hsu and Ayush Jaiswal and Premkumar Natarajan},
journal= {arXiv preprint arXiv:1907.03233},
year = {2019}
}
备注
To appear in Proceedings of Interspeech 2019