中文

RawNet:利用原始波形进行文本无关说话人验证的先进端到端深度神经网络

音频与语音处理 2019-07-18 v2 机器学习 声音

摘要

近来,使用深度神经网络直接对原始波形建模已在音频领域的多项任务中得到广泛研究。然而,在说话人验证中,原始波形的利用尚处于初步阶段,需要进一步研究。在本研究中,我们探索输入原始波形的端到端深度神经网络,以改进多个方面:前端说话人嵌入提取(包括模型架构、预训练方案、附加目标函数)以及后端分类。利用预训练方案调整模型架构可以提取说话人嵌入,显著提升性能。附加目标函数通过将传统的两阶段过程——提取语句级特征(如 i-vectors 或 x-vectors)和特征增强阶段(例如线性判别分析)——相合并,简化了说话人嵌入的提取过程。我们还探索了适合所提说话人嵌入的有效后端分类模型。我们提出了一种端到端系统,包含两个深度神经网络,一个用于语句级说话人嵌入提取的前端,另一个用于后端分类。在 VoxCeleb1 数据集上进行的实验表明,所提模型在无数据增强的系统中达到了最先进的性能。所提系统也可与采用数据增强的最先进 x-vector 系统相媲美。

关键词

引用

@article{arxiv.1904.08104,
  title  = {RawNet: Advanced end-to-end deep neural network using raw waveforms for text-independent speaker verification},
  author = {Jee-weon Jung and Hee-Soo Heo and Ju-ho Kim and Hye-jin Shim and Ha-Jin Yu},
  journal= {arXiv preprint arXiv:1904.08104},
  year   = {2019}
}

备注

Accepted for oral presentation at Interspeech 2019, code available at http://github.com/Jungjee/RawNet