中文

BUT 系统在 VoxCeleb 说话人识别挑战赛 2019 上的系统描述

音频与语音处理 2019-10-29 v1 计算与语言 声音

摘要

在本报告中,我们描述了布尔诺理工大学(BUT)团队提交至 VoxCeleb 说话人识别挑战赛(VoxSRC)2019 的系统。我们还对 VoxCeleb-1 测试集上不同系统进行了简要分析。针对固定条件与开放条件提交的系统的融合均包含 4 种卷积神经网络(CNN)拓扑。第一与第二个网络具有 ResNet34 拓扑并使用二维 CNN。最后两个网络为一维 CNN,并基于 x-vector 提取拓扑。部分网络使用加性间隔角度 softmax 进行了微调。特征采用了 Kaldi FBanks 与 Kaldi PLPs。固定条件与开放条件系统之间的差异在于所用训练数据与融合策略。在挑战赛评估集上,固定条件与开放条件下的最佳系统分别取得了 1.42% 与 1.26% 的 ERR。

关键词

引用

@article{arxiv.1910.12592,
  title  = {BUT System Description to VoxCeleb Speaker Recognition Challenge 2019},
  author = {Hossein Zeinali and Shuai Wang and Anna Silnova and Pavel Matějka and Oldřich Plchot},
  journal= {arXiv preprint arXiv:1910.12592},
  year   = {2019}
}