中文

从近场到远场说话人验证的多级迁移学习

声音 2021-06-18 v1 音频与语音处理

摘要

在远场说话人验证中,当注册语音与测试语音的条件不匹配时,说话人嵌入的性能容易退化。为解决此问题,我们在教师-学生框架中提出特征级和实例级迁移学习,以学习域不变嵌入空间。对于特征级知识迁移,我们设计对比损失将知识从教师模型迁移到学生模型,其不仅能减小类内距离,还能增大类间距离。此外,我们提出实例级成对距离迁移方法,迫使学生模型保留教师模型优化良好的嵌入空间中的成对实例距离。在 FFSVC 2020 评估集上,我们的 Full-eval trials 的 EER 相对于 Task2 Partial-eval trials 的融合系统结果相对降低了 13.9%。在 Task1 上,相较于冠军的 DenseNet 在 Partial-eval trials 上的结果,我们的 Full-eval trials 的 minDCF 相对降低了 6.3%。在 Task3 上,我们提出的方法在 Full-eval trials 上的 EER 和 minDCF 非常接近融合系统在 Partial-eval trials 上的结果。我们的结果也优于其他有竞争力的域自适应方法。

关键词

引用

@article{arxiv.2106.09320,
  title  = {Multi-Level Transfer Learning from Near-Field to Far-Field Speaker Verification},
  author = {Li Zhang and Qing Wang and Kong Aik Lee and Lei Xie and Haizhou Li},
  journal= {arXiv preprint arXiv:2106.09320},
  year   = {2021}
}