SpeakIn 面向 2022 远场说话人验证挑战赛的说话人验证系统
声音
2022-09-26 v1 人工智能
音频与语音处理
摘要
本文介绍了 SpeakIn 团队提交至 2022 远场说话人验证挑战赛(FFSVC2022)任务 1 与任务 2 的说话人验证(SV)系统。该挑战赛的 SV 任务聚焦于全监督远场说话人验证(任务 1)与半监督远场说话人验证(任务 2)问题。在任务 1 中,我们使用 VoxCeleb 与 FFSVC2020 数据集作为训练数据集;而在任务 2 中,仅使用 VoxCeleb 数据集作为训练集。我们为本挑战赛开发了基于 ResNet 与基于 RepVGG 的架构。采用全局统计池化结构与 MQMHA 池化结构将帧级特征跨时间聚合以获得 utterance 级表征。我们采用 AM-Softmax 与 AAM-Softmax 对所得嵌入进行分类。我们创新性地提出一种分阶段迁移学习方法:在预训练阶段保留说话人权重,且该阶段无正样本用于训练这些权重;随后在第二阶段同时使用正负样本对这些权重进行微调。相比传统迁移学习策略,该策略能更好地提升模型性能。采用 Sub-Mean 与 AS-Norm 后端方法解决域失配问题。在融合阶段,任务 1 融合三个模型,任务 2 融合两个模型。在 FFSVC2022 排行榜上,我们的提交在任务 1 的 EER 为 3.0049%,对应 minDCF 为 0.2938;任务 2 中 EER 与 minDCF 分别为 6.2060% 与 0.5232。我们的方法取得了优异性能,并在两项挑战任务中均排名第 1。
引用
@article{arxiv.2209.11625,
title = {The SpeakIn Speaker Verification System for Far-Field Speaker Verification Challenge 2022},
author = {Yu Zheng and Jinghan Peng and Yihao Chen and Yajun Zhang and Jialong Wang and Min Liu and Minqiang Xu},
journal= {arXiv preprint arXiv:2209.11625},
year = {2022}
}
备注
5 pages. arXiv admin note: text overlap with arXiv:2209.10846