中文

说话人嵌入提取、语音活动检测与重叠语音检测的联合训练用于说话人日记

音频与语音处理 2024-11-05 v1 声音

摘要

尽管端到端说话人日记系统如今广受欢迎,但由语音活动检测 (VAD)、说话人嵌入提取加聚类以及重叠语音检测 (OSD) 加处理组成的模块化系统在许多条件下仍能达到具有竞争力的性能。然而,模块化系统的主要缺点之一是需要独立运行(和训练)不同的模块。在本工作中,我们提出了一种方法,可以同时联合训练一个模型来生成说话人嵌入、VAD 和 OSD,并以标准方法一小部分的推理时间达到具有竞争力的性能。此外,联合推理带来了简化的整体流水线,使我们更接近一种可以针对说话人日记特定目标进行端到端训练的统一聚类方法。

关键词

引用

@article{arxiv.2411.02165,
  title  = {Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization},
  author = {Petr Pálka and Federico Landini and Dominik Klement and Mireia Diez and Anna Silnova and Marc Delcroix and Lukáš Burget},
  journal= {arXiv preprint arXiv:2411.02165},
  year   = {2024}
}