中文

基于端到端局部分割的重叠感知低延迟在线说话人日志

音频与语音处理 2021-09-15 v1 声音

摘要

我们提出将在线说话人日志作为增量聚类与应用于每 500ms 更新的滚动缓冲的局部日志的组合来处理。所提流水线的每一步都旨在充分利用近期提出的端到端重叠感知分割在检测和分离重叠说话人方面的强大能力。特别地,我们提出统计池化层(最初引入于 x-vector 架构)的修改版本,以对分割模型预测同时说话人的帧赋予更小权重。此外,我们从初始分割步骤导出不可链接约束,以防止在增量聚类步骤中错误合并两个局部说话人。最后,我们展示所提方法的延迟如何在 500ms 与 5s 之间调整以匹配特定用例的需求,并提供延迟对整体性能影响的系统分析(基于 AMI、DIHARD 和 VoxConverse)。

关键词

引用

@article{arxiv.2109.06483,
  title  = {Overlap-aware low-latency online speaker diarization based on end-to-end local segmentation},
  author = {Juan M. Coria and Hervé Bredin and Sahar Ghannay and Sophie Rosset},
  journal= {arXiv preprint arXiv:2109.06483},
  year   = {2021}
}

备注

To appear in ASRU 2021. Code available at https://github.com/juanmc2005/StreamingSpeakerDiarization/