中文

语音质量预测深度学习模型的可视化与解释

声音 2021-12-14 v1 机器学习 音频与语音处理

摘要

估计传输语音的质量已知是一项非平凡任务。传统上,测试参与者被要求对样本质量打分;如今,自动化方法已经可用。这些方法可分为:1)侵入式模型,使用原始信号与退化信号两者;2)非侵入式模型,仅需退化信号。近来,基于神经网络的非侵入式模型被证明优于基于信号处理的模型。然而,基于深度学习的模型的优势伴随着更难以解释的代价。为更深入理解预测模型,本文分析了非侵入式语音质量预测模型 NISQA。NISQA 由卷积神经网络(CNN)与循环神经网络(RNN)组成。CNN 的任务是逐帧计算语音质量预测的相关特征,而 RNN 对各个语音帧之间的时间依赖性建模。我们使用不同的解释算法来理解 CNN 自动学习的特征。以此方式,可识别出若干可解释特征,例如对噪声或强中断的敏感性。另一方面,发现多个特征携带冗余信息。

关键词

引用

@article{arxiv.2112.06219,
  title  = {Visualising and Explaining Deep Learning Models for Speech Quality Prediction},
  author = {H. Tilkorn and G. Mittag and S. Möller},
  journal= {arXiv preprint arXiv:2112.06219},
  year   = {2021}
}

备注

4 pages, 6 figures, In Proceedings of the DAGA 2021 (the annual conference of the German Acoustical Society, DEGA)