基于 X-Vector 的多类型广播语音转写语音活动检测
音频与语音处理
2021-12-10 v1 声音
摘要
语音活动检测(VAD)是自动语音识别中基础的预处理步骤。在广播行业中这一点尤为明显,因为该领域会遇到种类繁多的音频素材与录音条件。基于先前研究表明 x-vector 嵌入可应用于多种音频分类任务,我们探究了 x-vector 在区分语音与噪声方面的适用性。我们发现,所提出的基于 x-vector 的 VAD 系统在 AVA-Speech 上取得了检测干净语音的最佳报告分数,同时在噪声与音乐存在下仍保持鲁棒的 VAD 性能。此外,我们将该基于 x-vector 的 VAD 系统集成到现有的 STT 流水线中,并在多个广播数据集上将其性能与采用 WebRTC VAD 的基线系统进行比较。关键在于,我们提出的基于 x-vector 的 VAD 提升了真实世界广播音频上 STT 转写的准确率。
引用
@article{arxiv.2112.05016,
title = {X-Vector based voice activity detection for multi-genre broadcast speech-to-text},
author = {Misa Ogura and Matt Haynes},
journal= {arXiv preprint arXiv:2112.05016},
year = {2021}
}
备注
7 pages, 3 figures, 4 tables