SpeakerNet:用于文本无关说话人识别与验证的一维深度可分离卷积网络
音频与语音处理
2020-10-27 v1
摘要
我们提出 SpeakerNet——一种用于说话人识别与说话人验证任务的新神经架构。它由带有 1D 深度可分离卷积、批归一化和 ReLU 层的残差块组成。该架构使用基于 x-vector 的统计量池化层将变长语音映射为定长嵌入(q-vector)。SpeakerNet-M 是一个仅含 5M 参数的简单轻量模型。它不使用语音活动检测(VAD),并在 VoxCeleb1 cleaned 上取得 2.10% 的等错误率(EER),在 VoxCeleb1 trial 文件上取得 2.29% 的等错误率,性能接近当前最优。
引用
@article{arxiv.2010.12653,
title = {SpeakerNet: 1D Depth-wise Separable Convolutional Network for Text-Independent Speaker Recognition and Verification},
author = {Nithin Rao Koluguri and Jason Li and Vitaly Lavrukhin and Boris Ginsburg},
journal= {arXiv preprint arXiv:2010.12653},
year = {2020}
}
备注
Preprint, submitted to ICASSP 2021