中文

受 i-vector 与 PLDA 启发的端到端深度神经网络说话人识别

音频与语音处理 2018-01-09 v2 声音

摘要

近来,若干基于深度神经网络(DNN)的端到端说话人验证系统被提出。这些系统已被证明在文本相关任务以及短语音的文本无关任务中具有竞争力。然而,对于较长语音的文本无关任务,端到端系统仍不及标准的 i-vector + PLDA 系统。本工作中,我们开发了一个端到端说话人验证系统,其初始化以模仿 i-vector + PLDA 基线。该系统随后以端到端方式进一步训练,但受到正则化约束,使其不会偏离初始系统太远。通过这种方式,我们缓解了通常限制端到端系统性能的过拟合问题。所提系统在长时与短时语音上均优于 i-vector + PLDA 基线。

关键词

引用

@article{arxiv.1710.02369,
  title  = {End-to-end DNN Based Speaker Recognition Inspired by i-vector and PLDA},
  author = {Johan Rohdin and Anna Silnova and Mireia Diez and Oldrich Plchot and Pavel Matejka and Lukas Burget},
  journal= {arXiv preprint arXiv:1710.02369},
  year   = {2018}
}