中文

ERes2NetV2: 以计算效率提升短时说话人验证性能

音频与语音处理 2024-06-05 v1 信号处理

摘要

说话人验证系统在处理短时测试录音时会出现显著的性能下降。为了应对这一挑战,提出了一种多尺度特征融合方法,以有效地从短语音中捕获说话人特征。受限于模型大小,结合全局和局部特征融合的鲁棒骨干网络 Enhanced Res2Net 在短时说话人验证中表现出次优性能。为了进一步提升 ERes2Net 的短时特征提取能力,我们扩展了每个阶段内的通道维度。然而,这一修改也增加了模型参数数量和计算复杂度。为了缓解这个问题,我们通过剪枝冗余结构提出了一种改进的 ERes2NetV2,最终减少了模型参数和计算成本。在 VoxCeleb 数据集上进行的一系列实验展示了 ERes2NetV2 的优越性,其在 VoxCeleb1-O 上,对于全长测试达到了 0.61% 的 EER,对于 3 秒测试达到了 0.98% 的 EER,对于 2 秒测试达到了 1.48% 的 EER。

关键词

引用

@article{arxiv.2406.02167,
  title  = {ERes2NetV2: Boosting Short-Duration Speaker Verification Performance with Computational Efficiency},
  author = {Yafeng Chen and Siqi Zheng and Hui Wang and Luyao Cheng and Qian Chen and Shiliang Zhang and Junjie Li},
  journal= {arXiv preprint arXiv:2406.02167},
  year   = {2024}
}