中文

联合语音与重叠语音检测:跨多种音频设置与语音领域的基准测试

声音 2023-07-26 v1 人工智能 神经与进化计算 音频与语音处理 信号处理

摘要

语音活动检测与重叠语音检测(分别为VAD和OSD)是说话人日志化的关键预处理任务。最终的分割性能高度依赖于这些子任务的鲁棒性。近期研究表明,VAD和OSD可使用多类分类模型进行联合训练。然而,这些工作通常局限于特定语音领域,缺乏关于系统泛化能力的信息。本文提出了针对不同VAD和OSD模型在多种音频设置(单/多通道)和语音领域(如媒体、会议等)上的完整且新颖的基准测试。我们的2/3类系统结合了时间卷积网络(Temporal Convolutional Network)与适配于该设置的语音表示,优于最先进的结果。我们表明,这两个任务的联合训练在F1分数上提供了与两个专用VAD和OSD系统相当的性能,同时降低了训练成本。这种独特的架构也可用于单通道和多通道语音处理。

关键词

引用

@article{arxiv.2307.13012,
  title  = {Joint speech and overlap detection: a benchmark over multiple audio setup and speech domains},
  author = {Martin Lebourdais and Théo Mariotte and Marie Tahon and Anthony Larcher and Antoine Laurent and Silvio Montresor and Sylvain Meignier and Jean-Hugh Thomas},
  journal= {arXiv preprint arXiv:2307.13012},
  year   = {2023}
}