中文

通过生成语音片段调试深度神经网络

机器学习 2019-07-09 v1 音频与语音处理 机器学习

摘要

深度神经网络(DNN)能够成功处理并分类语音片段。然而,理解 DNN 做出分类的原因十分困难。图像分类 DNN 所采用的一种调试方法是激活最大化,其生成被分类为某一类的示例图像。本工作中,我们评估该方法对语音片段分类器的适用性,以此作为理解 DNN“听什么”的手段。我们使用语音指令语料库训练一个分类器,然后利用激活最大化从训练好的模型中抽取样本。随后我们使用 WaveNet 声码器从特征合成音频以进行主观分析。我们通过客观测量与众包人工评估来衡量生成样本的质量。结果表明,当与自然语音先验结合时,激活最大化可用于生成不同类别的示例。基于这些结果,激活最大化可用于开始打开语音任务中 DNN 的黑箱。

关键词

引用

@article{arxiv.1907.03164,
  title  = {Towards Debugging Deep Neural Networks by Generating Speech Utterances},
  author = {Bilal Soomro and Anssi Kanervisto and Trung Ngo Trong and Ville Hautamäki},
  journal= {arXiv preprint arXiv:1907.03164},
  year   = {2019}
}

备注

Accepted to Interspeech 2019