中文

基于元学习设计神经说话人嵌入

音频与语音处理 2020-08-03 v1 声音

摘要

使用分类目标训练的神经网络说话人嵌入已在多项应用中展现出最先进的性能。通常,此类嵌入在一个域外语料库上以单一任务(如说话人分类)进行训练,尽管具有大量类别(说话人)。本工作中,我们在元学习范式下重新表述嵌入训练。我们将训练语料库重新分配为多个相关说话人分类任务的集合,并学习对未见说话人泛化更好的表示。首先,我们开发了一个开源工具包来训练 x-vector,其性能在说话人日志化和说话人验证应用中与预训练的 Kaldi 模型相当。我们发现架构中不同的瓶颈层对不同应用有不同程度的偏好。接下来,我们使用两种元学习策略,即原型网络和关系网络,来改进 x-vector 嵌入。我们性能最佳的模型在 DIHARD II 开发语料库和 AMI 会议语料库上分别实现了说话人错误率 12.37% 和 7.11% 的相对提升。我们分析了 DIHARD 语料库中不同领域的改进。值得注意的是,在具有挑战性的儿童语音领域,我们研究了儿童年龄与日志化性能之间的关系。此外,我们展示了在 SITW 语料库(7.68%)和 VOiCES 挑战语料库(8.78%)上说话人验证等错误率的降低。我们观察到元学习在这些语料库所遇到的具有挑战性的声学条件和录音设置中尤其有益。我们的实验说明了元学习作为训练深度神经说话人嵌入的通用学习范式的适用性。

关键词

引用

@article{arxiv.2007.16196,
  title  = {Designing Neural Speaker Embeddings with Meta Learning},
  author = {Manoj Kumar and Tae Jin-Park and Somer Bishop and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2007.16196},
  year   = {2020}
}