中文

说话人识别中 PLDA 域自适应的广义框架

音频与语音处理 2020-08-21 v1 声音

摘要

本文提出了一种说话人识别中概率线性判别分析(PLDA)域自适应的广义框架。它不仅包含了几种现有的有监督和无监督域自适应方法,还使得不同域中可用数据的使用更加灵活。特别地,我们在此引入以下两种新技术:(1)基于相关对齐的插值和(2)协方差正则化。所提出的基于相关对齐的插值方法相较于自适应前的域外 PLDA 模型,将 minCprimary 降低了至多 30.5%,且 minCprimary 也比具有最优插值权重的传统线性插值方法低 5.5%。此外,所提出的正则化技术确保了插值相对于变化插值权重的鲁棒性,这在实际应用中至关重要。

关键词

引用

@article{arxiv.2008.08815,
  title  = {A Generalized Framework for Domain Adaptation of PLDA in Speaker Recognition},
  author = {Qiongqiong Wang and Koji Okabe and Kong Aik Lee and Takafumi Koshinaka},
  journal= {arXiv preprint arXiv:2008.08815},
  year   = {2020}
}

备注

ICASSP 2020 (45th International Conference on Acoustics, Speech, and Signal Processing)