用于说话人识别的最大间隔度量学习
声音
2016-04-01 v2 机器学习
摘要
概率线性判别分析(PLDA)是i-vector模型的一种流行归一化方法,并在说话人识别中提供了最先进的性能。然而,PLDA模型的一个潜在问题是它本质上假设说话人向量上的高斯分布,这在实践中不总是成立。此外,目标函数与任务目标(例如区分真实说话人和冒名者)不直接相关。本文中,我们提出一种最大间隔度量学习方法来解决这些问题。它学习一个线性变换,其准则是目标试验和冒名者试验之间的间隔被最大化。在SRE08核心测试上进行的实验表明,与PLDA相比,新方法有可比甚至更好的性能,尽管打分仅是余弦计算。
引用
@article{arxiv.1510.05940,
title = {Max-margin Metric Learning for Speaker Recognition},
author = {Lantian Li and Dong Wang and Chao Xing and Thomas Fang Zheng},
journal= {arXiv preprint arXiv:1510.05940},
year = {2016}
}