中文

基于 SincNet 与 X-Vector 融合的说话人识别

计算与语言 2020-04-07 v1 声音 音频与语音处理

摘要

在本文中,我们提出了一种创新方法,通过融合两个近期引入的深度神经网络(DNN),即 SincNet 和 X-Vector,来执行说话人识别。在原始语音波形上使用 SincNet 滤波器的想法是,在 CNN 架构的初始卷积层中提取更具区分性的频率相关特征。X-Vector 被用于利用如下事实:该嵌入是一种从变长语音片段中高效提取固定维度特征的方法,这在普通 CNN 技术中是具有挑战性的,使其在速度和精度上都高效。我们的方法通过在深层模型的后续层组合 X-Vector,同时在初始层使用 SincNet 滤波器,兼取两者之长。该方法使网络能够学习更好的嵌入并更快收敛。先前的工作使用 X-Vector 或 SincNet 滤波器或其某些变体,然而我们引入了一种新颖的融合架构,其中我们将两种技术结合以收集更多关于语音信号的信息,从而给出更好的结果。我们的方法聚焦于 VoxCeleb1 数据集进行说话人识别,并且我们已将其用于训练和测试。

关键词

引用

@article{arxiv.2004.02219,
  title  = {Speaker Recognition using SincNet and X-Vector Fusion},
  author = {Mayank Tripathi and Divyanshu Singh and Seba Susan},
  journal= {arXiv preprint arXiv:2004.02219},
  year   = {2020}
}

备注

The 19th International Conference on Artificial Intelligence and Soft Computing