中文

基于三元组神经网络在稀疏数据集上用于多目标说话人检测与识别的潜空间表示

声音 2019-10-07 v2 机器学习 音频与语音处理

摘要

我们提出了一种使用三元组神经网络(Triplet Neural Networks)解决说话人识别问题的方法。目前,带有概率线性判别分析(PLDA)的 ii-vector 表示由于较高的分类准确率和相对较短的计算时间,是解决该问题最常用的技术。在本文中,我们探索了一种神经网络方法,即三元组神经网络(TNNs),为不同分类器构建潜空间,以解决多目标说话人检测与识别挑战评测 2018(MCE 2018)数据集。该训练集包含来自 3,631 个说话人的 ii-vectors,每个说话人仅 3 个样本,因此使得说话人识别成为一项具有挑战性的任务。当使用训练集和开发集来训练 TNN 与基线模型(即直接在 ii-vector 表示上进行相似度评估)时,我们提出的模型比基线高出 23%。当将训练数据缩减为仅使用训练集时,我们的方法在多目标说话人识别任务中产生了 309 次混淆,比基线模型好 46%。这些结果表明,TNNs 的表示能力在每类可用样本很少的小数据集上训练时尤为明显。

关键词

引用

@article{arxiv.1910.01463,
  title  = {Latent space representation for multi-target speaker detection and identification with a sparse dataset using Triplet neural networks},
  author = {Kin Wai Cheuk and Balamurali B. T. and Gemma Roig and Dorien Herremans},
  journal= {arXiv preprint arXiv:1910.01463},
  year   = {2019}
}

备注

Accepted for ASRU 2019