中文

基于神经聚类的触发式说话人归属语音识别

音频与语音处理 2024-09-04 v2

摘要

本文提出一种新颖的方法,用于基于神经聚类方法的说话人归属语音识别转录。通过并行处理机制,语音分割和语音识别可以同时应用,有助于防止级联系统中一个子系统错误累积到下一个子系统。通过使用采用序列化输出训练方法训练的语音识别器,以及用于分配说话人标签的段级判别神经聚类(SDNC),来实现上述目的。通过SDNC,我们的系统无需额外的非神经聚类方法即可分配说话人标签,从而使整个系统基于神经网络。在AMI会议数据集上进行的实验结果表明,SDNC相对于谱聚类(SC)在AMI Eval集合上将说话人分割错误率(DER)降低了19%。当与使用SC的级联系统相比,采用SDNC的并行系统在Dev/Eval集合上分别给出约7%/4%的相对cpWER改进。

关键词

引用

@article{arxiv.2407.02007,
  title  = {SOT Triggered Neural Clustering for Speaker Attributed ASR},
  author = {Xianrui Zheng and Guangzhi Sun and Chao Zhang and Philip C. Woodland},
  journal= {arXiv preprint arXiv:2407.02007},
  year   = {2024}
}

备注

To appear in Interspeech 2024