中文

基于部分 AUC 优化与类中心学习的深度说话人嵌入用于文本无关说话人验证

机器学习 2019-11-20 v1 声音 音频与语音处理

摘要

基于深度嵌入的文本无关说话人验证在许多挑战性场景中已展现出优于传统方法的性能。其损失函数通常可分为两类,即验证类和识别类。验证损失函数与说话人验证流程相匹配,但难以实现。因此,大多数最先进的深度嵌入方法使用带 softmax 输出单元或其变体的识别损失函数。本文中,我们提出一种验证损失函数,称为接收者操作特征(ROC)曲线下部分面积(pAUC)的最大化,用于基于深度嵌入的文本无关说话人验证。我们还提出一种基于类中心的训练三元组构造方法以提高训练效率,这对于所提损失函数在性能上可与识别损失相媲美至关重要。在 Speaker in the Wild (SITW) 和 NIST SRE 2016 数据集上的实验表明,所提 pAUC 损失函数与最先进的识别损失函数极具竞争力。

关键词

引用

@article{arxiv.1911.08077,
  title  = {Partial AUC optimization based deep speaker embeddings with class-center learning for text-independent speaker verification},
  author = {Zhongxin Bai and Xiao-Lei Zhang and Jingdong Chen},
  journal= {arXiv preprint arXiv:1911.08077},
  year   = {2019}
}