中文

深度说话人嵌入的组合用于说话人日记化

声音 2021-05-10 v3 机器学习 音频与语音处理

摘要

在将 d-vector 作为从神经网络(NN)说话人分类器提取的说话人嵌入用于语音片段聚类之后,说话人日记化最近取得了显著进展。为提取性能更优且更鲁棒的说话人嵌入,本文提出一种 c-vector 方法,通过组合源自具有不同 NN 组件的系统的多组互补 d-vector 实现。采用三种结构实现 c-vector,即二维自注意力、门控加性和双线性池化结构,分别依赖于注意力机制、门控机制和低秩双线性池化机制。此外,本文还提出了一种基于神经网络的单遍说话人日记化流程,其使用 NN 实现语音活动检测、说话人变化点检测和说话人嵌入提取。在由 4–10 名说话人的真实会议及广泛声学条件构成的具有挑战性的 AMI 和 NIST RT05 数据集上进行了实验与详细分析。对于在 AMI 训练集上训练的系统,在 AMI dev 和 eval 集上分别通过使用 c-vector 替代 d-vector 获得了 13% 和 29% 的相对说话人错误率(SER)降低,并且在 RT05 上观察到 15% 的 SER 相对降低,显示了所提方法的鲁棒性。通过将 VoxCeleb 数据纳入训练集,最佳的 c-vector 系统在 AMI dev、eval 和 RT05 集上相比 d-vector 分别实现了 7%、17% 和 16% 的相对 SER 降低。

关键词

引用

@article{arxiv.2010.12025,
  title  = {Combination of Deep Speaker Embeddings for Diarisation},
  author = {Guangzhi Sun and Chao Zhang and Phil Woodland},
  journal= {arXiv preprint arXiv:2010.12025},
  year   = {2021}
}

备注

Manualscript accepted by Neural Networks