中文

分析与改进用于 ASR 的神经说话人嵌入

计算与语言 2023-09-21 v2 音频与语音处理 机器学习

摘要

神经说话人嵌入通过 DNN 模型编码说话人的语音特征,并广泛用于说话人验证任务。然而,很少有研究探讨神经说话人嵌入在 ASR 系统中的使用。在这项工作中,我们展示了将神经说话人嵌入整合到基于 conformer 的混合 HMM ASR 系统中的努力。对于 ASR,我们改进的嵌入提取流程结合 Weighted-Simple-Add 整合方法,使 x-vector 和 c-vector 达到与 i-vector 相当的性能。我们进一步比较和分析不同的说话人嵌入。我们展示了通过将 newbob 学习率调度切换为单周期学习调度所获得的声学模型改进,在 Switchboard 上实现了约 3% 的相对 WER 降低,并将总训练时间额外减少 17%。通过进一步添加神经说话人嵌入,我们在 Hub5'00 上获得额外的约 3% 相对 WER 提升。我们最佳的带说话人嵌入的基于 Conformer 的混合 ASR 系统在 SWB 300h 训练下于 Hub5'00 和 Hub5'01 上实现了 9.0% 的 WER。

关键词

引用

@article{arxiv.2301.04571,
  title  = {Analyzing And Improving Neural Speaker Embeddings for ASR},
  author = {Christoph Lüscher and Jingjing Xu and Mohammad Zeineldeen and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:2301.04571},
  year   = {2023}
}

备注

Accepted at ITG Speech Communications 2023