中文

上海交通大学-思必驰用于 VoxCeleb 说话人识别挑战赛 2022 的系统

声音 2022-09-21 v2 音频与语音处理

摘要

本报告描述了 SJTU-AISPEECH 用于 Voxceleb 说话人识别挑战赛 2022 的系统。对于 track1,我们实现了两类系统:在线系统与离线系统。探索了不同的基于 ResNet 的主干网络与损失函数。我们最终的融合系统在 track1 获得第 3 名。对于 track3,我们实现了基于统计自适应与联合训练的域适应。在基于联合训练的域适应中,我们以不同训练目标联合训练源域与目标域数据集以进行域适应。我们为 target 域数据探索了两种不同的训练目标:基于自监督学习的角原型损失,以及基于半监督学习、带估计伪标签的分类损失。此外,当目标域目标为分类损失时,我们使用动态损失门与标签纠正(DLG-LC)策略以提升伪标签质量。我们最终的融合系统在 track3 获得第 4 名(非常接近第 3 名,相对差距小于 1%)。

关键词

引用

@article{arxiv.2209.09076,
  title  = {SJTU-AISPEECH System for VoxCeleb Speaker Recognition Challenge 2022},
  author = {Zhengyang Chen and Bing Han and Xu Xiang and Houjun Huang and Bei Liu and Yanmin Qian},
  journal= {arXiv preprint arXiv:2209.09076},
  year   = {2022}
}

备注

System description of VoxSRC 2022