中文

用于自动说话人识别的深度神经网络并未学习超音段时间特征

声音 2024-07-10 v2 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

尽管深度神经网络在自动说话人识别及相关任务中取得了令人印象深刻的成果,但人们对究竟是什么导致了这些结果的理解仍很不令人满意。先前的工作将部分成功归因于它们建模超音段时间信息(SST)的能力,即除了谱特征之外还能学习语音的节奏-韵律特征。在本文中,我们(i)提出并应用一种新颖的测试,以量化最先进的说话人识别神经网络的性能在多大程度上可由建模SST来解释;以及(ii)提出若干种迫使相应网络更多地关注SST并评估其效果的方法。我们发现,多种基于CNN和RNN的说话人识别神经网络架构即便在被迫情况下也未能在足够程度上建模SST。这些结果为未来更好地利用完整语音信号的有影响力研究提供了高度相关的基础,并深入揭示了此类网络的内部工作机制,增强了深度学习在语音技术中的可解释性。

关键词

引用

@article{arxiv.2311.00489,
  title  = {Deep Neural Networks for Automatic Speaker Recognition Do Not Learn Supra-Segmental Temporal Features},
  author = {Daniel Neururer and Volker Dellwo and Thilo Stadelmann},
  journal= {arXiv preprint arXiv:2311.00489},
  year   = {2024}
}

备注

7 pages, 2 figures, 3 tables