HCCL 系统参加 NIST SRE21
声音
2022-07-12 v1 音频与语音处理
摘要
本文描述了 HCCL 团队为 NIST 2021 说话人识别评测(NIST SRE21)所开发的系统。我们首先探索了各种最先进(state-of-the-art)的说话人嵌入提取器,并结合一种新颖的 circle loss 以获得判别性的深度说话人嵌入。考虑到跨信道和跨语言说话人识别是 SRE21 的关键挑战,我们引入了若干技术来减少跨域失配。具体而言,Codec 和语音增强被直接应用于原始语音以消除编解码器及环境噪声失配。我们将这些直接作用于语音以消除相对显式失配的方法统称为数据自适应方法。实验表明,数据自适应方法相较我们的基线取得了 15% 的提升。此外,一些流行的后端域自适应算法被部署于说话人嵌入上,以缓解由隐式失配引起的说话人性能退化。分数校准是我们在 SRE21 中的一个主要失败点。原因在于具有过多参数的分数校准容易导致过拟合问题。
引用
@article{arxiv.2207.04676,
title = {The HCCL System for the NIST SRE21},
author = {Zhuo Li and Runqiu Xiao and Hangting Chen and Zhenduo Zhao and Zihan Zhang and Wenchao Wang},
journal= {arXiv preprint arXiv:2207.04676},
year = {2022}
}
备注
accepted by interspeech 2022