中文

基于多语言语音识别系统的语音活动检测

声音 2021-04-13 v2 音频与语音处理

摘要

为了更好地建模上下文信息并提升语音活动检测(SAD)系统的泛化能力,本文利用多语言自动语音识别(ASR)系统来执行SAD。使用无格最大互信息(LF-MMI)损失函数对声学模型(AM)进行序列判别训练,可有效提取输入声学帧的上下文信息。多语言AM训练增强了对噪声和语言变化的鲁棒性。将最大输出后验的索引视为帧级语音/非语音判决函数。采用多数投票和逻辑回归来融合与语言相关的判决。多语言ASR在BABEL数据集的18种语言上训练,所构建的SAD在3种不同语言上评估。在域外数据集上,所提出的SAD模型相较基线模型表现出显著更优的性能。在Ester2数据集上,在不使用任何域内数据的情况下,该模型在检测错误率(DetER)指标上分别优于WebRTC、基于音素识别器的VAD(Phn Rec)和Pyannote基线(绝对提升分别为7.1%、1.7%和2.7%)。类似地,在LiveATC数据集上,该模型在DetER指标上分别优于WebRTC、Phn Rec和Pyannote基线(绝对提升分别为6.4%、10.0%和3.7%)。

关键词

引用

@article{arxiv.2010.12277,
  title  = {Speech Activity Detection Based on Multilingual Speech Recognition System},
  author = {Seyyed Saeed Sarfjoo and Srikanth Madikeri and Petr Motlicek},
  journal= {arXiv preprint arXiv:2010.12277},
  year   = {2021}
}

备注

Submitted to Interspeech 2021