基于深度神经网络的少样本说话人识别
音频与语音处理
2019-04-19 v1 机器学习
声音
摘要
深度学习的近期进展主要由大量训练数据的可用性驱动。然而,对于诸如说话人识别等特定任务,此类数据并不总是可获取,因为在实际场景中收集大量数据并不可行。因此,本文提出仅从少量训练样本学习来识别说话人。为此,我们使用带有原型损失(prototypical loss)的深度神经网络,其输入为谱图。在输出端,我们将类特征向量投影到公共嵌入空间中,随后进行分类。此外,我们展示了胶囊网络(capsule net)在少样本学习设置中的有效性。为此,我们利用自编码器从胶囊网络获得的类特定嵌入中学习广义特征嵌入。我们在公开可用数据集和竞争性基线上进行了详尽实验,证明了所提出的少样本学习流程的优越性与泛化能力。
引用
@article{arxiv.1904.08775,
title = {Few Shot Speaker Recognition using Deep Neural Networks},
author = {Prashant Anand and Ajeet Kumar Singh and Siddharth Srivastava and Brejesh Lall},
journal= {arXiv preprint arXiv:1904.08775},
year = {2019}
}