中文

说话人识别模型的弱监督训练

声音 2018-06-25 v1 计算与语言 人机交互 音频与语音处理

摘要

我们提出了一种以弱监督方式训练说话人识别模型的方法。我们关注于如下设定:训练数据由一组音频录音组成,且说话人标注仅在录音级别提供。该方法使用说话人日志(speaker diarization)找出每段录音中的不同说话人,并使用 i-vectors 将每位说话人的语音投影到固定维向量。随后训练一个神经网络将 i-vectors 映射到说话人,采用一种特殊的目标函数,使得能够利用录音级说话人标签对模型进行优化。我们在两个不同的真实世界数据集上进行了实验。在 VoxCeleb 数据集上,该方法在闭集说话人识别任务上取得了 94.6% 的准确率,大幅超越基线性能。在一个爱沙尼亚广播新闻数据集上,该方法在 93% 精确率下取得了 66% 的时间加权说话人识别召回率。

关键词

引用

@article{arxiv.1806.08621,
  title  = {Weakly Supervised Training of Speaker Identification Models},
  author = {Martin Karu and Tanel Alumäe},
  journal= {arXiv preprint arXiv:1806.08621},
  year   = {2018}
}

备注

Odyssey 2018 The Speaker and Language Recognition Workshop