Uniphore在Fearless Steps挑战赛第二阶段的提交系统
音频与语音处理
2020-06-11 v1 声音
摘要
我们针对Fearless Steps挑战赛第二阶段的语音活动检测(SAD)和说话人识别(SID)任务提出了有监督系统。这两个任务的 proposed 系统共享一个共同的卷积神经网络(CNN)架构。使用梅尔频谱作为特征。对于语音活动检测,将频谱图划分为较小的重叠块。网络被训练来识别这些块。SID任务所使用的网络架构和训练步骤与SAD任务类似,不同之处在于使用了更长的频谱图块。我们为SID任务提出了一种两级识别方法。首先,对于每个块,基于神经网络后验概率假设一组说话人。最后,通过应用投票规则利用块级假设来识别话语的说话人身份。在SAD任务上,在开发集和评测集上分别获得了5.96%和5.33%的检测代价函数分数。在SID任务上,开发集和评测集分别获得了82.07%和82.42%的top 5检索准确率。对结果进行了简要分析,以深入了解两个任务中分类错误的案例。
引用
@article{arxiv.2006.05747,
title = {Uniphore's submission to Fearless Steps Challenge Phase-2},
author = {Karthik Pandia D S and Cosimo Spera},
journal= {arXiv preprint arXiv:2006.05747},
year = {2020}
}