中文

说话人识别中参数化后端泛化域自适应框架

音频与语音处理 2023-05-26 v1

摘要

最先进的说话人识别系统包括说话人嵌入前端,其后接概率线性判别分析(PLDA)后端。这些组件的有效性依赖于大量有标签训练数据的可用性。在实践中,系统部署的域(例如语言、信道、人口统计)通常与训练系统的域不同。为缩小由此产生的差距,域自适应对于 PLDA 模型通常是必不可少的。其两个变体包括重尾 PLDA(HT-PLDA)和高斯 PLDA(G-PLDA)。尽管前者比后者更好地拟合真实特征空间,但其流行度严重受限于其计算复杂性,尤其是由于其非高斯特性导致的域自适应困难。针对 G-PLDA 已提出多种域自适应方法。本文提出了一种可应用于上述两种 PLDA 变体用于说话人识别的泛化域自适应框架。它不仅包含了几种现有的监督与无监督域自适应方法,还使得不同域中可用数据的使用更加灵活。特别地,我们在此引入两种新技术:(1) 模型级相关对齐,以及 (2) 协方差正则化。据我们所知,这是首次提出将此类技术用于 HT-PLDA 的域自适应。所提技术的有效性已在 NIST 2016、2018 和 2019 说话人识别评测(SRE'16、SRE'18 和 SRE'19)数据集上通过实验验证。

关键词

引用

@article{arxiv.2305.15567,
  title  = {Generalized domain adaptation framework for parametric back-end in speaker recognition},
  author = {Qiongqiong Wang and Koji Okabe and Kong Aik Lee and Takafumi Koshinaka},
  journal= {arXiv preprint arXiv:2305.15567},
  year   = {2023}
}