中文

用于多注册语句完全端到端说话人验证的联合说话人编码器与神经后端模型

音频与语音处理 2022-09-02 v1 声音

摘要

传统的自动说话人验证系统通常可分解为前端模型(如用于提取说话人嵌入的时延神经网络 TDNN)和后端模型(如基于统计的概率线性判别分析 PLDA 或基于神经网络的神经 PLDA(NPLDA))以进行相似度打分。然而,前端与后端模型的顺序优化可能导致局部极小,这在理论上阻碍整个系统达到最优优化。尽管已提出一些联合优化两模型的方法,如广义端到端(GE2E)模型和 NPLDA E2E 模型,但这些方法均设计用于单一注册语句。本文中,我们提出一种新的 E2E 联合方法用于说话人验证,特别针对多注册语句的实际场景设计。为利用多注册语句间的内在关系,我们的模型配备了帧级和语句级注意力机制。我们还利用了多种数据增强技术,包括使用 MUSAN 和 RIRs 数据集的常规噪声增强,以及一种独特的说话人嵌入级混合策略以实现更好的优化。

关键词

引用

@article{arxiv.2209.00485,
  title  = {Joint Speaker Encoder and Neural Back-end Model for Fully End-to-End Automatic Speaker Verification with Multiple Enrollment Utterances},
  author = {Chang Zeng and Xiaoxiao Miao and Xin Wang and Erica Cooper and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2209.00485},
  year   = {2022}
}

备注

Submitted to TASLP