北京建筑大学用于 2022 VoxCeleb 说话人识别挑战赛的说话人日志系统
声音
2022-09-21 v1 音频与语音处理
摘要
本文描述了北京建筑大学(BUCEA)用于 2022 VoxCeleb 说话人识别挑战赛的说话人日志系统。Voxsrc-22 提供了 VoxConverse 的开发集和测试集,我们主要使用 VoxConverse 的测试集进行参数调整。我们的系统由多个模块组成,包括语音活动检测(VAD)、说话人嵌入提取器、聚类方法、重叠语音检测(OSD)和结果融合。在不考虑重叠的情况下,应用 Dover-LAP(Diarization Output Voting Error Reduction 的缩写)方法进行系统融合,并最终进行重叠语音检测与处理。我们的最佳系统在 VoxSRC 2022 评估集上分别取得了 5.48% 的日志错误率(DER)和 32.1% 的 Jaccard 错误率(JER)。
引用
@article{arxiv.2209.09635,
title = {The BUCEA Speaker Diarization System for the VoxCeleb Speaker Recognition Challenge 2022},
author = {Ruohua Zhou and Yuxuan Du and Chenlei Hu},
journal= {arXiv preprint arXiv:2209.09635},
year = {2022}
}