中文

基于具显式归纳偏置师生网络的开集短语音法庭说话人验证

音频与语音处理 2020-09-22 v1 机器学习 声音

摘要

在法庭应用中,通常只能获取由复杂或未知声学环境下的短语音组成的小型自然数据集。本研究提出一种流程化方案,以改善在小型实际法庭现场数据集上的说话人验证性能。通过利用大规模域外数据集,提出了一种基于知识蒸馏的目标函数用于师生学习,并应用于短语音法庭说话人验证。该目标函数综合考虑说话人分类损失、Kullback-Leibler散度以及嵌入向量的相似性。为使训练得到的深度说话人嵌入网络对小型目标数据集具有鲁棒性,我们引入一种新策略,将预训练学生模型作为微调起点和正则化中的参考,从而将其微调至法庭目标域。所提方法在1st48-UTD法庭语料库上进行了评估,该语料库是新建立的由实际凶杀案调查组成的自然数据集,包含在非受控条件下录制的短语音。我们表明,所提目标函数能有效提升师生学习在短语音上的性能,且我们的微调策略通过提供朝向预训练模型的显式归纳偏置,优于常用的权重衰减方法。

关键词

引用

@article{arxiv.2009.09556,
  title  = {Open-set Short Utterance Forensic Speaker Verification using Teacher-Student Network with Explicit Inductive Bias},
  author = {Mufan Sang and Wei Xia and John H. L. Hansen},
  journal= {arXiv preprint arXiv:2009.09556},
  year   = {2020}
}

备注

Accepted to INTERSPEECH 2020