中文

基于 WavLM 预训练特征的重叠语音与性别检测

声音 2022-09-12 v1 人工智能 音频与语音处理

摘要

本文聚焦于重叠语音与性别检测,以研究法国视听媒体中女性与男性间的互动(性别平等监测项目)。在该应用背景下,我们需要依据说话人性别自动分割语音信号,并识别至少两名说话人同时说话的时刻。我们提出使用 WavLM 模型——其优势在于在海量语音数据上进行了预训练——来构建重叠语音检测(OSD)与性别检测(GD)系统。本研究中我们使用了两个不同语料库。DIHARD III 语料库非常适配 OSD 任务但缺乏性别信息。ALLIES 语料库契合项目应用背景。我们最佳的 OSD 系统是以 WavLM 预训练特征为输入的时序卷积网络(TCN),在 DIHARD 上达到了新的 SOTA F1-score 性能。一个神经 GD 以 WavLM 输入在法国广播新闻 ALLIES 数据的性别平衡子集上训练,取得了 97.9% 的准确率。该工作为人文科学研究者关于法国媒体中男女表征差异提供了新视角。

关键词

引用

@article{arxiv.2209.04167,
  title  = {Overlapped speech and gender detection with WavLM pre-trained features},
  author = {Martin Lebourdais and Marie Tahon and Antoine Laurent and Sylvain Meignier},
  journal= {arXiv preprint arXiv:2209.04167},
  year   = {2022}
}

备注

Submitted and accepted to Interspeech 2022