深度说话人识别中数据增强的可视化分析
声音
2023-05-26 v1 音频与语音处理
摘要
可视化对于理解神经网络的内部机制具有重要价值。先前工作发现 LayerCAM 是深度说话人模型的可靠可视化工具。本文中,我们使用 LayerCAM 分析被广泛采用的数据增强(DA)方法,以理解其如何带来模型鲁棒性。我们在 VoxCeleb1 数据集上进行了说话人识别实验,表明原始(vanilla)与基于激活(Act)的 DA 方法均增强了对干扰的鲁棒性,且 Act DA 始终更优。LayerCAM 可视化表明 DA 帮助模型学会删除被干扰破坏的时频(TF)单元。“学会删除”的行为解释了为何 DA 模型比干净模型更鲁棒,以及为何当干扰为非目标语音时 Act DA 优于原始 DA。然而,LayerCAM 仍无法清晰解释 Act DA 在其他情形下的优越性,表明需进一步研究。
引用
@article{arxiv.2305.16070,
title = {Visualizing data augmentation in deep speaker recognition},
author = {Pengqi Li and Lantian Li and Askar Hamdulla and Dong Wang},
journal= {arXiv preprint arXiv:2305.16070},
year = {2023}
}
备注
to be published in INTERSPEECH 2023