中文

基于多出口架构的联合语音活动与重叠语音检测

声音 2022-09-27 v1 人工智能 计算与语言 机器学习 音频与语音处理

摘要

重叠语音检测(OSD)对于多 party 对话场景下的语音应用至关重要。尽管已有大量研究努力和进展,与语音活动检测(VAD)相比,OSD 仍是一个开放挑战,其整体性能远不能令人满意。大多数先前研究通常将 OSD 问题表述为标准分类问题,在帧级以二分类(OSD)或三分类标签(联合 VAD 与 OSD)识别语音。与主流不同,本研究从新视角探讨联合 VAD 与 OSD 任务。具体而言,我们提出用多出口架构扩展传统分类网络。该架构赋予系统利用来自早期出口的低层特征或来自最后出口的高层特征识别类别的独特能力。此外,采用知识蒸馏与密集连接两种训练方案以进一步提升系统性能。在基准数据集(AMI 和 DIHARD-III)上的实验结果验证了所提系统的有效性与通用性。我们的消融实验进一步揭示了所提方案的互补贡献。在 AMI 上取得 F1F_1 分数 0.792、在 DIHARD-III 上取得 0.625,我们的系统不仅优于这些数据集上的若干顶尖模型,还以大幅优势超越当前最先进水平。除性能优势外,所提系统还为质量-复杂度权衡提供了另一诱人潜力,这对于高效的 OSD 部署极为有利。

关键词

引用

@article{arxiv.2209.11906,
  title  = {Joint Speech Activity and Overlap Detection with Multi-Exit Architecture},
  author = {Ziqing Du and Kai Liu and Xucheng Wan and Huan Zhou},
  journal= {arXiv preprint arXiv:2209.11906},
  year   = {2022}
}