中文

基于深度CNN的文本提示说话人识别特征提取器

音频与语音处理 2018-03-15 v1 计算与语言 机器学习 声音 机器学习

摘要

深度学习在说话人确认领域仍不是一种很常用的工具。我们研究了深度卷积神经网络在文本提示说话人确认任务中的性能。将提示的口令分割为词状态——即数字——以分别测试每个数字语音。我们为所有状态训练了一个单一的高层特征提取器,并使用余弦相似度度量进行打分。我们网络的关键特征是最大特征图(Max-Feature-Map)激活函数,其充当嵌入式特征选择器。通过使用多任务学习方案来训练该高层特征提取器,我们能够在质量上超越经典基线系统,并作为一种新手方法取得了令人印象深刻的成果,在RSR2015评估集上获得了2.85%的EER。所提系统与基线系统的融合进一步改善了该结果。

关键词

引用

@article{arxiv.1803.05307,
  title  = {Deep CNN based feature extractor for text-prompted speaker recognition},
  author = {Sergey Novoselov and Oleg Kudashev and Vadim Schemelinin and Ivan Kremnev and Galina Lavrentyeva},
  journal= {arXiv preprint arXiv:1803.05307},
  year   = {2018}
}

备注

Submitted to ICASSP 2018