应用于说话人识别的基于 Jeffreys 散度的神经网络输出分布正则化
声音
2023-12-29 v1 音频与语音处理
摘要
本文提出了一种用于深度神经网络说话人识别的新的损失函数,该函数基于 Jeffreys 散度。将此散度加入交叉熵损失函数,可以在平滑非目标值的同时最大化输出分布的目标值。该目标函数提供了高度判别性的特征。除这一效果外,我们提出了对其有效性的理论证明,并试图理解该损失函数如何影响模型,特别是对数据集类型(即相对于训练语料库的领域内或领域外数据)的影响。我们的实验表明,Jeffreys 损失在说话人识别上始终优于现有技术,尤其是在领域外数据上,并有助于限制误报。
引用
@article{arxiv.2312.16885,
title = {Jeffreys divergence-based regularization of neural network output distribution applied to speaker recognition},
author = {Pierre-Michel Bousquet and Mickael Rouvier},
journal= {arXiv preprint arXiv:2312.16885},
year = {2023}
}
备注
Accepted in ICASSP 2023