端到端说话人验证中度量学习损失函数的比较
机器学习
2020-04-02 v1 声音
音频与语音处理
机器学习
摘要
尽管度量学习方法日益普及,但很少有研究尝试对这些技术在说话人验证中进行公平比较。我们试图填补这一空白,并在 VoxCeleb 数据集上以系统的方式比较了几种度量学习损失函数。第一类损失函数源自交叉熵损失(通常用于监督分类),包括同余余弦损失、加性角度间隔损失和中心损失。第二类损失函数侧重于训练样本之间的相似性,包括对比损失和三元组损失。我们表明,加性角度间隔损失函数在学习更鲁棒的表示的同时,其表现优于研究中所有其他损失函数。基于 SincNet 可训练特征和 x-vector 架构的组合,本文使用的网络在与加性角度间隔损失结合时,使我们向真正的端到端说话人验证系统迈进了一步,同时仍保持与 x-vector 基线相当的竞争力。本着可复现研究的精神,我们还发布了用于复现我们结果的开源 Python 代码,并在 torch.hub 上共享了预训练的 PyTorch 模型,这些模型可以直接使用或微调后使用。
引用
@article{arxiv.2003.14021,
title = {A Comparison of Metric Learning Loss Functions for End-To-End Speaker Verification},
author = {Juan M. Coria and Hervé Bredin and Sahar Ghannay and Sophie Rosset},
journal= {arXiv preprint arXiv:2003.14021},
year = {2020}
}