中文

一种基于交叉门并行 CNN 的语音特征融合新方法用于说话人识别

音频与语音处理 2022-11-28 v1 声音

摘要

本文提出一种基于交叉门并行卷积神经网络(CG-PCNN)的说话人识别语音特征融合新方法。通过多个梅尔滤波器组可从说话人语音的每帧中提取不同频率分辨率的梅尔滤波器组特征(MFBFs),这些梅尔滤波器组中三角滤波器的数量不同。由于这些 MFBFs 的频率分辨率不同,它们之间具有互补性。CG-PCNN 用于从这些 MFBFs 中提取深度特征,其采用交叉门机制捕捉互补性以提升说话人识别系统性能。随后,通过拼接这些深度特征获得融合特征用于说话人识别。实验结果表明,采用所提语音特征融合方法的说话人识别系统有效,并略微优于现有最先进系统。

关键词

引用

@article{arxiv.2211.13377,
  title  = {A new Speech Feature Fusion method with cross gate parallel CNN for Speaker Recognition},
  author = {Jiacheng Zhang and Wenyi Yan and Ye Zhang},
  journal= {arXiv preprint arXiv:2211.13377},
  year   = {2022}
}