中文

基于小波卷积的语音端点动态精确检测

音频与语音处理 2018-09-26 v1

摘要

语音端点的精确检测是影响诸如自动语音识别(ASR)系统等需从语音信号中提取语音片段的系统性能的重要因素。现有端点检测(EPD)方法多基于短时能量(STE)、过零率(ZCR)及其变体。但基于 STE 和 ZCR 的 EPD 算法在存在说话人产生的非语音声音伪迹(NSAs)时常常失效。也有基于模式识别和分类技术提出的算法,但需要标注数据用于训练。本文提出一种称为基于小波卷积的语音端点检测(WCSEPD)的新算法来提取语音端点。WCSEPD 利用小波卷积将语音信号分解为高频和低频分量,并计算两个频率分量的基于熵的阈值。低频阈值用于提取浊音语音段,而高频阈值用于通过滤除非语音声音伪迹来提取清音语音段。WCSEPD 不需要任何标注数据用于训练,且能自动提取语音段。实验结果表明,所提算法在存在 NSAs 的情况下能精确提取语音端点。

关键词

引用

@article{arxiv.1804.06159,
  title  = {Precise Detection of Speech Endpoints Dynamically: A Wavelet Convolution based approach},
  author = {Tanmoy Roy and Tshilidzi Marwala and Snehashish Chakraverty},
  journal= {arXiv preprint arXiv:1804.06159},
  year   = {2018}
}

备注

25 Pages