基于质心的深度度量学习用于说话人识别
机器学习
2019-02-08 v1 声音
音频与语音处理
机器学习
摘要
利用神经网络将话语映射到距离反映说话人相似度的空间的说话人嵌入模型,推动了说话人识别任务近期的进展。然而,在训练集说话人与未见说话人上的识别性能仍存在显著差距。后者对应于少样本学习任务,即训练好的模型在未见类别上评估。在此,我们使用原型网络损失(PNL)——少样本图像分类任务中的先进方法——来优化说话人嵌入模型。所得嵌入模型在说话人验证与辨认任务中,对于已见和未见说话人均优于基于三元组损失(triplet loss)的先进模型。
引用
@article{arxiv.1902.02375,
title = {Centroid-based deep metric learning for speaker recognition},
author = {Jixuan Wang and Kuan-Chieh Wang and Marc Law and Frank Rudzicz and Michael Brudno},
journal= {arXiv preprint arXiv:1902.02375},
year = {2019}
}
备注
ICASSP 2019 (44th International Conference on Acoustics, Speech, and Signal Processing)