中文

SpeakerNet:用于文本无关说话人识别与验证的一维深度可分离卷积网络

音频与语音处理 2020-10-27 v1

摘要

我们提出 SpeakerNet——一种用于说话人识别与说话人验证任务的新神经架构。它由带有 1D 深度可分离卷积、批归一化和 ReLU 层的残差块组成。该架构使用基于 x-vector 的统计量池化层将变长语音映射为定长嵌入(q-vector)。SpeakerNet-M 是一个仅含 5M 参数的简单轻量模型。它不使用语音活动检测(VAD),并在 VoxCeleb1 cleaned 上取得 2.10% 的等错误率(EER),在 VoxCeleb1 trial 文件上取得 2.29% 的等错误率,性能接近当前最优。

关键词

引用

@article{arxiv.2010.12653,
  title  = {SpeakerNet: 1D Depth-wise Separable Convolutional Network for Text-Independent Speaker Recognition and Verification},
  author = {Nithin Rao Koluguri and Jason Li and Vitaly Lavrukhin and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2010.12653},
  year   = {2020}
}

备注

Preprint, submitted to ICASSP 2021