中文

基于残差网络谱映射的模仿架构探索

声音 2018-09-27 v1 音频与语音处理

摘要

谱映射使用深度神经网络(DNN)直接从带噪语音映射到干净语音。我们之前的研究发现,当利用在干净语音上训练的声学模型所提供的有用线索时,谱映射的性能会大幅提升。映射网络学习模仿谱分类器所偏好的输入,并相应地清理特征。在本研究中,我们探索两项新创新:我们用更契合预测干净语音目标的残差网络替代基于 DNN 的谱映射器。我们还考察了在模仿准则中整合长期上下文(通过宽残差双向 LSTM 网络)相较于 DNN 如何影响谱映射的性能。我们的目标是推导出一个可用作任意识别系统预处理器的模型;从我们模型导出的特征通过标准 Kaldi ASR 流程,取得了 9.3% 的词错误率(WER),这是仅使用特征自适应的 CHiME-2 数据集上记录到的最低词错误率。

关键词

引用

@article{arxiv.1809.09756,
  title  = {An Exploration of Mimic Architectures for Residual Network Based Spectral Mapping},
  author = {Peter Plantinga and Deblin Bagchi and Eric Fosler-Lussier},
  journal= {arXiv preprint arXiv:1809.09756},
  year   = {2018}
}

备注

Published in the IEEE 2018 Workshop on Spoken Language Technology (SLT 2018)