中文

深度说话人嵌入特征提取器的比较再评估

音频与语音处理 2020-07-31 v1 机器学习 声音

摘要

现代自动说话人验证在很大程度上依赖于在梅尔频率倒谱系数(MFCC)特征上训练的深度神经网络(DNNs)。尽管存在基于相位、韵律和长时域操作的替代特征提取方法,但它们尚未与基于 DNN 的方法一起被广泛研究。我们旨在通过提供在 VoxCeleb 和 SITW 数据集上对 14 种特征提取器的广泛再评估来填补这一空白。我们的发现表明,配备谱质心、群延迟函数和集成噪声抑制等技术的特征为深度说话人嵌入提取提供了有前景的 MFCC 替代方案。实验结果表明,等错误率(EER)相对于基线在 VoxCeleb 上降低了至多 16.3%,在 SITW 上降低了至多 25.1%。

关键词

引用

@article{arxiv.2007.15283,
  title  = {A Comparative Re-Assessment of Feature Extractors for Deep Speaker Embeddings},
  author = {Xuechen Liu and Md Sahidullah and Tomi Kinnunen},
  journal= {arXiv preprint arXiv:2007.15283},
  year   = {2020}
}

备注

Accepted to Interspeech 2020