基于分块分类的状态转移模型用于端点检测
音频与语音处理
2019-12-24 v1 声音
摘要
提出了一种基于分块分类的状态转移模型(STM)用于端点检测(EPD)。通常,EPD 是利用逐帧语音活动检测(VAD)配合附加的 STM 开发的,其中状态转移基于 VAD 的帧级判决(语音或非语音)进行。然而,即使在噪声环境中我们使用最先进的基于深度神经网络的 VAD,VAD 错误也频繁发生,这会导致 STM 发生不期望的状态转移。在本工作中,为构建鲁棒的 STM,状态转移基于分块分类进行,因为 EPD 无需在帧级执行。块由多帧组成,块在语音与非语音之间的分类通过聚合 VAD 对多帧的判决来完成,从而使得块内一些不期望的 VAD 错误可被其他正确的 VAD 判决平滑掉。最后,该模型在定性与定量度量(包括音素错误率)下进行了评估。
引用
@article{arxiv.1912.10442,
title = {End-Point Detection with State Transition Model based on Chunk-Wise Classification},
author = {Juntae Kim and Jaesung Bae and Minsoo Hahn},
journal= {arXiv preprint arXiv:1912.10442},
year = {2019}
}