华为用于 VoxCeleb 说话人日志挑战赛的说话人日志系统
声音
2020-10-26 v2 计算与语言
音频与语音处理
摘要
本文描述了我们提交至 VoxCeleb 说话人识别挑战赛 2020 说话人日志赛道(Track 4)的系统配置。我们的日志系统包含一个训练良好的基于神经网络的语音增强模型,作为输入语音信号的预处理前端。我们用基于神经网络的 VAD 替代了传统的基于能量的语音活动检测(VAD)。基于神经网络的 VAD 能更准确地标注仅含背景音乐、噪声及其他干扰的语音段,这对日志性能至关重要。我们采用 x-vectors 的凝聚式层次聚类(AHC)以及基于变分贝叶斯隐马尔可夫模型(VB-HMM)的迭代聚类进行说话人聚类。实验结果表明,我们提出的系统相较基线系统取得显著提升,在评测集上得到说话人日志错误率(DER)10.45% 与 Jacard 错误率(JER)22.46%。
引用
@article{arxiv.2010.11657,
title = {The HUAWEI Speaker Diarisation System for the VoxCeleb Speaker Diarisation Challenge},
author = {Renyu Wang and Ruilin Tong and Yu Ting Yeung and Xiao Chen},
journal= {arXiv preprint arXiv:2010.11657},
year = {2020}
}
备注
5 pages, 2 figures, A report about our diarisation system for VoxCeleb Challenge, Interspeech conference workshop