中文

深度说话人识别的可靠可视化

声音 2022-04-13 v2 音频与语音处理

摘要

尽管卷积神经网络(CNNs)在说话人识别中取得了令人瞩目的成功,我们对 CNN 内部功能的理解仍然有限。一个主要障碍是一些流行的可视化工具难以应用,例如那些生成显著图的工具。原因在于说话人信息在时频空间中不呈现清晰的空间模式,这使得可视化结果难以解释,进而难以确认可视化工具的可靠性。本文基于 CAM 对三种流行可视化方法 Grad-CAM、Score-CAM 和 Layer-CAM 进行广泛分析,以研究它们在说话人识别任务中的可靠性。在最先进的 ResNet34SE 模型上的实验表明,Layer-CAM 算法能产生可靠可视化,因此可作为解释基于 CNN 的说话人模型的有前景工具。源代码与示例见我们的项目页:http://project.cslt.org/。

关键词

引用

@article{arxiv.2204.03852,
  title  = {Reliable Visualization for Deep Speaker Recognition},
  author = {Pengqi Li and Lantian Li and Askar Hamdulla and Dong Wang},
  journal= {arXiv preprint arXiv:2204.03852},
  year   = {2022}
}

备注

submitted to INTERSPEECH 2022