边界至关重要:面向更具区分性的说话人识别深度神经网络嵌入
音频与语音处理
2019-06-19 v1 计算与语言
声音
摘要
近来,从说话人判别深度神经网络(DNN)中提取的说话人嵌入比i-vector等传统方法性能更优。在大多数情况下,DNN说话人分类器使用带softmax的交叉熵损失训练。然而,此类损失函数未显式鼓励类间可分离性与类内紧凑性。因此,这些嵌入对于说话人识别任务并非最优。本文中,为解决该问题,将三种不同的基于边界的损失引入深度说话人嵌入学习,它们不仅分离类别,还要求类别间具有固定边界。可以证明,边界是获得更具区分性说话人嵌入的关键。实验在两个公开文本无关任务上进行:VoxCeleb1与Speaker in The Wild(SITW)。所提方法可实现最先进性能,与使用带softmax交叉熵损失的强基线相比,在两个任务上等错误率(EER)降低25%~30%,分别在VoxCeleb1测试集上获得2.238% EER、在SITW core-core测试集上获得2.761% EER。
引用
@article{arxiv.1906.07317,
title = {Margin Matters: Towards More Discriminative Deep Neural Network Embeddings for Speaker Recognition},
author = {Xu Xiang and Shuai Wang and Houjun Huang and Yanmin Qian and Kai Yu},
journal= {arXiv preprint arXiv:1906.07317},
year = {2019}
}
备注
not accepted by INTERSPEECH 2019