中文

用于说话人识别的非局部卷积神经网络 (nlcnn)

声音 2021-05-21 v2 音频与语音处理

摘要

说话人识别是基于声音识别说话人的过程。随着 Amazon Alexa 等智能语音助手近年来的普及,该技术受到更多关注。过去几年中,各种基于卷积神经网络 (CNN) 的说话人识别算法被提出并取得了令人满意的性能。然而,卷积操作通常是一次在局部邻域上进行的构建模块,因此错失了在特征层面上捕获对理解说话人声音模式至关重要的全局长程交互。在这项工作中,我们提出应用非局部卷积神经网络 (NLCNN) 来提升在特征层面捕获长程依赖的能力,从而改善说话人识别性能。具体而言,我们引入非局部块,其中某一位置的输出响应计算为所有位置输入特征的加权和。将非局部块与预定义的 CNN 网络结合,我们研究了 NLCNN 模型的有效性。在无需大量调参的情况下,所提出的 NLCNN 模型在公开 Voxceleb 数据集上优于最先进的说话人识别算法。此外,我们研究了分别应用于频时域、时域、频域和帧级的不同类型非局部操作。其中,时域对说话人识别应用最为有效。

关键词

引用

@article{arxiv.2011.03682,
  title  = {Non-local convolutional neural networks (nlcnn) for speaker recognition},
  author = {Haici Yang and Hongda Mao and Ruirui Li and Chelsea J. T. Ju and Oguz Elibol},
  journal= {arXiv preprint arXiv:2011.03682},
  year   = {2021}
}