中文

SpeakIn系统在CNSRC2022中的系统描述

声音 2022-09-23 v1 人工智能 音频与语音处理

摘要

本报告描述了我们用于2022年CN-Celeb说话人识别挑战赛(CNSRC 2022)任务的说话人验证系统。该挑战赛包含说话人验证(SV)与说话人检索(SR)两项任务。SV任务包含固定赛道与开放赛道两个赛道。在固定赛道中,我们仅使用CN-Celeb.T作为训练集。对于SV任务的开放赛道与SR任务,我们额外加入了开源音频数据。我们为本次挑战赛开发了基于ResNet、基于RepVGG和基于TDNN的架构。采用全局统计池化结构与MQMHA池化结构将帧级特征跨时间聚合以获得语句级表征。我们采用AM-Softmax与AAM-Softmax并结合Sub-Center方法对所得嵌入进行分类。我们还使用了Large-Margin Fine-Tuning策略以进一步提升模型性能。在后端,使用了Sub-Mean与AS-Norm。在SV任务固定赛道中,我们的系统为五个模型的融合,而在SV任务开放赛道中融合了两个模型。在SR任务中我们使用了单一系统。我们的方法取得了优越性能,在SV任务开放赛道获得第1名、SV任务固定赛道第2名、SR任务第3名。

关键词

引用

@article{arxiv.2209.10846,
  title  = {The SpeakIn System Description for CNSRC2022},
  author = {Yu Zheng and Yihao Chen and Jinghan Peng and Yajun Zhang and Min Liu and Minqiang Xu},
  journal= {arXiv preprint arXiv:2209.10846},
  year   = {2022}
}

备注

4 pages