用于 VoxCeleb 说话人识别挑战赛 2022 的 Royalflush 系统
声音
2022-09-21 v2 人工智能
音频与语音处理
摘要
在本技术报告中,我们描述了 Royalflush 针对 VoxCeleb 说话人识别挑战赛 2022(VoxSRC-22)的提交方案。我们的提交包含赛道 1(有监督说话人验证)与赛道 3(半监督说话人验证)。对于赛道 1,我们开发了一种具有对称架构的基于 U-Net 的说话人嵌入提取器。所提系统在验证集上取得了 2.06% 的 EER 与 0.1293 的 MinDCF。与最先进的 ECAPA-TDNN 相比,其在 EER 上获得 20.7% 的相对提升,在 MinDCF 上获得 22.70% 的相对提升。对于赛道 3,我们采用源域监督与目标域自监督的联合训练来获得说话人嵌入提取器。后续的聚类过程可获取目标域伪说话人标签。我们以有监督方式利用所有源域与目标域数据对说话人嵌入提取器进行自适应,从而充分利用两个域的信息。此外,聚类与有监督域自适应可重复进行,直至验证集上性能收敛。我们最终的提交为 10 个模型的融合,在验证集上取得了 7.75% EER 与 0.3517 MinDCF。
引用
@article{arxiv.2209.09010,
title = {The Royalflush System for VoxCeleb Speaker Recognition Challenge 2022},
author = {Jingguang Tian and Xinhui Hu and Xinkang Xu},
journal= {arXiv preprint arXiv:2209.09010},
year = {2022}
}