微软面向 VoxCeleb 说话人识别挑战赛 2020 的说话人日志系统
音频与语音处理
2020-10-26 v2 声音
摘要
本文描述了微软针对真实场景下单声道多说话人录音的说话人日志系统,该系统在 VoxCeleb 说话人识别挑战赛(VoxSRC)2020 的日志赛道上进行了评测。我们首先阐述为处理真实多说话人录音问题而设计的系统架构,随后给出各组件细节,包括基于 Res2Net 的说话人嵌入提取器、基于 conformer 的带泄漏滤波的连续语音分离,以及用于系统融合的改进 DOVER(Diarization Output Voting Error Reduction,说话人日志输出投票错误率降低)方法。我们使用 VoxSRC 2020 挑战赛提供的数据集评测系统,该数据集包含从 YouTube 收集的真实生活多说话人音频。我们的最佳系统在开发集和评测集上分别取得 3.71% 和 6.23% 的说话人日志错误率(DER),在挑战赛日志赛道上排名第一。
引用
@article{arxiv.2010.11458,
title = {Microsoft Speaker Diarization System for the VoxCeleb Speaker Recognition Challenge 2020},
author = {Xiong Xiao and Naoyuki Kanda and Zhuo Chen and Tianyan Zhou and Takuya Yoshioka and Sanyuan Chen and Yong Zhao and Gang Liu and Yu Wu and Jian Wu and Shujie Liu and Jinyu Li and Yifan Gong},
journal= {arXiv preprint arXiv:2010.11458},
year = {2020}
}
备注
5 pages, 3 figures, 2 tables