STC用于NIST SRE 2021的说话人识别系统
声音
2021-11-04 v1 机器学习
音频与语音处理
摘要
本文介绍了STC Ltd.提交至NIST 2021说话人识别评测的系统,涵盖固定与开放训练条件。这些系统由若干基于深度神经网络作为特征提取器的异构子系统组成。在NIST 2021 SRE挑战期间,我们专注于使用基于加性角间隔的损失函数训练最先进的深度说话人嵌入提取器如ResNets和ECAPA网络。此外,受近期wav2vec 2.0特征在自动语音识别中成功的启发,我们探索了该方法在说话人验证领域的有效性。据我们观察,对预训练的大型wav2vec 2.0模型进行微调为我们在开放赛道条件下提供了性能最佳的系统中。我们在固定条件下基于wav2vec 2.0提取器的实验表明,采用对比预测编码损失的无人监督自回归预训练为从原始语音信号训练强大的基于transformer的提取器打开了大门。对于视频模态,我们开发了以RetinaFace人脸检测器和在大型人脸图像数据集上训练的深度ResNet人脸嵌入提取器构成的最佳方案。主系统的最终结果通过子系统在分数层的不同配置融合及随后的分数校准获得。
引用
@article{arxiv.2111.02298,
title = {STC speaker recognition systems for the NIST SRE 2021},
author = {Anastasia Avdeeva and Aleksei Gusev and Igor Korsunov and Alexander Kozlov and Galina Lavrentyeva and Sergey Novoselov and Timur Pekhovsky and Andrey Shulipa and Alisa Vinogradova and Vladimir Volokhov and Evgeny Smirnov and Vasily Galyuk},
journal= {arXiv preprint arXiv:2111.02298},
year = {2021}
}