面向端到端说话人确认的角 softmax 损失
音频与语音处理
2018-12-13 v2
摘要
端到端说话人确认系统受到越来越多的关注。传统的 i-vector 方法训练一个生成式模型(基本是因子分析模型)来提取 i-vector 作为说话人嵌入。相比之下,端到端方法直接训练一个判别模型(通常是神经网络)来学习判别性说话人嵌入;一个关键组成部分是训练准则。在本文中,我们使用角 softmax(A-softmax),其最初为人脸验证提出,作为端到端说话人确认中特征学习的损失函数。通过在 softmax 损失中引入类间间隔,A-softmax 能比 softmax 损失与三元组损失学习到更具判别性的特征,同时易于使用且稳定。我们在本工作中做出两点贡献。1)我们将 A-softmax 损失引入端到端说话人确认并取得了显著的 EER 降低。2)我们发现,在前端训练中使用 A-softmax 与在后端打分中使用 PLDA 相结合,进一步提升了端到端系统在短语音条件(注册与测试均短)下的性能。实验在 数据集的部分数据上进行,证明了使用 A-softmax 带来的改进。
引用
@article{arxiv.1806.03464,
title = {Angular Softmax Loss for End-to-end Speaker Verification},
author = {Yutian Li and Feng Gao and Zhijian Ou and Jiasong Sun},
journal= {arXiv preprint arXiv:1806.03464},
year = {2018}
}