中文

RepSPKNet 在说话人验证中的有效性

声音 2021-10-20 v1 音频与语音处理

摘要

多分支卷积神经网络架构因多个并行分支的聚合能显著提升性能,在说话人验证中引起了广泛关注。然而,由于模型参数和额外操作的增加,该设计在推理时效率不够高。本文提出一种使用重参数化技术的新型多分支网络架构 RepSPKNet。借助该技术,我们的骨干模型在推理时呈现高效的类 VGG 状态,而其训练时为复杂的多分支结构。我们首次将 RepVGG 的具体结构引入说话人验证,并提出了该结构的若干变体。性能在基于 VoxCeleb 的测试集上进行了评估。我们证明分支多样性和分支容量在 RepSPKNet 设计中均起重要作用。我们的 RepSPKNet 在 VoxCeleb1-H 上以 1.5982% 的 EER 和 0.1374 的 minDCF 取得了最先进的性能。

关键词

引用

@article{arxiv.2110.09720,
  title  = {Rep Works in Speaker Verification},
  author = {Yufeng Ma and Miao Zhao and Yiwei Ding and Yu Zheng and Min Liu and Minqiang Xu},
  journal= {arXiv preprint arXiv:2110.09720},
  year   = {2021}
}

备注

submitted to ICASSP 2022