中文

分析语言与信道不匹配下的说话人验证嵌入提取器与后端

音频与语音处理 2022-03-22 v1

摘要

本文分析了领域和语言不匹配情况下说话人嵌入与后端评分模型的行为和性能。我们展示了关于基于 ResNet 的说话人嵌入架构的研究结果,并表明减少时间步幅可提升性能。随后,我们考虑了一个 PLDA 后端,并展示了小说话人子空间、语言依赖的 PLDA 混合以及干扰属性投影的组合如何对系统性能产生巨大影响。此外,我们提出了一种高效的评分与融合类别后验 logit 向量的方法,该方法近期被证明在说话人验证任务中表现良好。实验使用 NIST SRE 2021 设置进行。

关键词

引用

@article{arxiv.2203.10300,
  title  = {Analyzing speaker verification embedding extractors and back-ends under language and channel mismatch},
  author = {Anna Silnova and Themos Stafylakis and Ladislav Mosner and Oldrich Plchot and Johan Rohdin and Pavel Matejka and Lukas Burget and Ondrej Glembek and Niko Brummer},
  journal= {arXiv preprint arXiv:2203.10300},
  year   = {2022}
}

备注

Submitted to Odyssey 2022, under review