中文

在线说话人分割系统延迟的系统评估

计算与语言 2024-07-08 v1 声音 音频与语音处理

摘要

本文在相同的硬件和相同的测试数据上评估了不同的在线说话人分割系统的延迟。延迟指从音频输入到对应说话人标签输出之间的时间间隔。作为评估的一部分,我们比较了 DIART 框架内各种模型组合,基于在线聚类算法 UIS-RNN-SML 的该框架,以及端到端在线说话人分割系统 FS-EEND。实验结果表明,DIART 流水线使用嵌入模型 pyannote/embedding 和分段模型 pyannote/segmentation 可实现最低延迟。FS-EEND 系统显示出类似的良好延迟。总体而言,目前没有 published research 严格比较多个在线说话人分割系统的延迟。这使得本工作更为相关。

关键词

引用

@article{arxiv.2407.04293,
  title  = {Systematic Evaluation of Online Speaker Diarization Systems Regarding their Latency},
  author = {Roman Aperdannier and Sigurd Schacht and Alexander Piazza},
  journal= {arXiv preprint arXiv:2407.04293},
  year   = {2024}
}

备注

6 pages