中文

基于3D卷积神经网络的文本无关说话人验证

计算机视觉与模式识别 2018-06-08 v7

摘要

本文提出了一种使用三维卷积神经网络(3D-CNN)架构的新颖方法,用于文本无关设置下的说话人验证。主要挑战之一是说话人模型的创建。先前报道的大多数方法基于对说话人话语中提取的特征进行平均来创建说话人模型,这被称为d-向量系统。在我们的论文中,我们提出了一种利用3D-CNN进行自适应特征学习的方法,用于直接创建说话人模型,其中,在开发阶段和注册阶段,每个说话人相同数量的语音话语被馈送到网络,以表示说话人的话语并创建说话人模型。这可以同时捕获说话人相关信息,并构建一个更鲁棒的系统以应对说话人内部变异。我们证明,所提出的方法显著优于传统的d-向量验证系统。此外,通过利用3D-CNN,所提出的系统也可以作为传统d-向量系统(一种单样本说话人建模系统)的替代方案。

关键词

引用

@article{arxiv.1705.09422,
  title  = {Text-Independent Speaker Verification Using 3D Convolutional Neural Networks},
  author = {Amirsina Torfi and Jeremy Dawson and Nasser M. Nasrabadi},
  journal= {arXiv preprint arXiv:1705.09422},
  year   = {2018}
}

备注

Accepted to be published in IEEE International Conference on Multimedia and Expo (ICME) 2018