RepSPKNet 在说话人验证中的有效性
声音
2021-10-20 v1 音频与语音处理
摘要
多分支卷积神经网络架构因多个并行分支的聚合能显著提升性能,在说话人验证中引起了广泛关注。然而,由于模型参数和额外操作的增加,该设计在推理时效率不够高。本文提出一种使用重参数化技术的新型多分支网络架构 RepSPKNet。借助该技术,我们的骨干模型在推理时呈现高效的类 VGG 状态,而其训练时为复杂的多分支结构。我们首次将 RepVGG 的具体结构引入说话人验证,并提出了该结构的若干变体。性能在基于 VoxCeleb 的测试集上进行了评估。我们证明分支多样性和分支容量在 RepSPKNet 设计中均起重要作用。我们的 RepSPKNet 在 VoxCeleb1-H 上以 1.5982% 的 EER 和 0.1374 的 minDCF 取得了最先进的性能。
引用
@article{arxiv.2110.09720,
title = {Rep Works in Speaker Verification},
author = {Yufeng Ma and Miao Zhao and Yiwei Ding and Yu Zheng and Min Liu and Minqiang Xu},
journal= {arXiv preprint arXiv:2110.09720},
year = {2021}
}
备注
submitted to ICASSP 2022