中文

基于说话人基向量与全说话人难负样本挖掘的端到端损失函数用于说话人验证

音频与语音处理 2019-07-18 v3 机器学习 声音

摘要

近年来,说话人验证主要使用深度神经网络进行,这些网络被训练为从频谱图或梅尔滤波器组能量等输入特征中输出嵌入向量。设计包括度量学习在内的各种损失函数的研究已被广泛探索。在本研究中,我们利用可训练参数的说话人基(speaker basis)概念,提出两种用于说话人验证的端到端损失函数。一个损失函数旨在进一步增大说话人间差异,另一个旨在以难负样本挖掘(hard negative mining)实现相同概念。每个说话人基被设计为在深度神经网络训练过程中表示该对应说话人。与只能考虑 mini-batch 中包含的有限数量说话人的传统损失函数不同,所提损失函数能够考虑训练集中的所有说话人,而不受 mini-batch 构成影响。特别是,所提损失函数支持难负样本挖掘以及考虑所有说话人的说话人间差异计算。通过在 VoxCeleb1 和 VoxCeleb2 数据集上的实验,我们确认所提损失函数可补充传统的 softmax 与 center loss 函数。

关键词

引用

@article{arxiv.1902.02455,
  title  = {End-to-end losses based on speaker basis vectors and all-speaker hard negative mining for speaker verification},
  author = {Hee-Soo Heo and Jee-weon Jung and IL-Ho Yang and Sung-Hyun Yoon and Hye-jin Shim and Ha-Jin Yu},
  journal= {arXiv preprint arXiv:1902.02455},
  year   = {2019}
}

备注

5 pages and 2 figures