云知声用于 VoxCeleb 说话人识别挑战赛 2023 的系统
音频与语音处理
2023-08-25 v1 机器学习
声音
摘要
本报告介绍了云知声(UNISOUND)为 2023 年 VoxCeleb 说话人识别挑战赛(VoxSRC 2023)Track1 和 Track2 所提交的方案。我们在 Track 1 和 Track 2 上提交了相同的系统,该系统仅使用 VoxCeleb2-dev 进行训练。我们为本次挑战赛开发了大规模 ResNet 和 RepVGG 架构。我们提出了一种一致性感知的分数校准方法,该方法通过一致性度量因子(Consistency Measure Factor, CMF)利用音频声纹在相似度分数上的稳定性。CMF 在本次挑战赛中带来了巨大的性能提升。我们的最终系统为六个模型的融合,在 VoxSRC 2023 的 Track 1 中获得第一名,在 Track 2 中获得第二名。我们提交结果的 minDCF 为 0.0855,EER 为 1.5880%。
引用
@article{arxiv.2308.12526,
title = {UNISOUND System for VoxCeleb Speaker Recognition Challenge 2023},
author = {Yu Zheng and Yajun Zhang and Chuanying Niu and Yibin Zhan and Yanhua Long and Dongxing Xu},
journal= {arXiv preprint arXiv:2308.12526},
year = {2023}
}