中文

研究 CNN 中用于说话人验证的挤压-激励机制

音频与语音处理 2021-09-14 v1 声音

摘要

在说话人验证中,语音表示的提取主要基于残差神经网络(ResNet)架构。ResNet 建立在卷积层之上,卷积层学习滤波器以捕获沿所有输入的局部空间模式,然后生成联合编码空间和通道信息的特征图。遗憾的是,卷积层中的所有特征图都是独立且局部地学习的(卷积层未利用特征图之间的依赖关系)。该问题最初在图像处理中得到解决。一种称为挤压-激励(SE)的通道注意力机制最近被提出用于卷积层并应用于说话人验证。该机制对跨特征图提取的信息进行重新加权。在本文中,我们首先对 SE 机制应用于说话人验证任务在 ResNet 不同阶段的影晌和作用进行了一项原创性的定性研究,然后评估了几种 SE 架构。我们最终提出用一种基于均值池化和标准差池化拼接的新池化变体来改进 SE 方法。结果表明,仅在 ResNet 的最初阶段应用 SE 能更好地为验证任务捕获说话人信息,并且使用所提出的池化变体在 Voxceleb1-E、Voxceleb1-H 和 SITW 评估任务上获得了显著的判别增益。

关键词

引用

@article{arxiv.2109.05977,
  title  = {Studying squeeze-and-excitation used in CNN for speaker verification},
  author = {Mickael Rouvier and Pierre-Michel Bousquet},
  journal= {arXiv preprint arXiv:2109.05977},
  year   = {2021}
}