中文

基于域分离网络的无监督自适应用于鲁棒语音识别

计算与语言 2019-05-01 v2 人工智能 声音 音频与语音处理

摘要

语音信号的无监督域自适应旨在将训练良好的源域声学模型自适应到来自目标域的无标签数据。这可通过深度神经网络(DNN)声学模型的对抗训练实现,以学习既具 senone 判别性又域不变的中间深度表示。具体地,DNN 被训练为以对抗目标函数联合优化 senone 分类主任务与域分类辅助任务。本工作中,我们不止聚焦于学习域不变特征(即域间共享分量),还通过私有分量提取器 DNN 显式建模各域的私有分量来刻画源域与目标域分布间的差异。私有分量被训练为与共享分量正交,从而隐式提升共享分量的域不变程度。重构器 DNN 用于从私有与共享分量重构原始语音特征作为正则化。该域分离框架应用于无监督环境自适应任务,在 CHiME-3 数据集上相对于代表性对抗训练方法梯度反转层训练取得了 11.08% 的相对 WER 降低,用于自动语音识别。

关键词

引用

@article{arxiv.1711.08010,
  title  = {Unsupervised Adaptation with Domain Separation Networks for Robust Speech Recognition},
  author = {Zhong Meng and Zhuo Chen and Vadim Mazalov and Jinyu Li and Yifan Gong},
  journal= {arXiv preprint arXiv:1711.08010},
  year   = {2019}
}

备注

8 pages, 1 figure, ASRU 2017