中文

用于语音检测的增强型因子化三向受限玻尔兹曼机

声音 2017-04-24 v3 机器学习 机器学习

摘要

在本文中,我们提出增强型因子化三向受限玻尔兹曼机(EFTW-RBMs)用于语音检测。所提模型通过乘以第三单元的动态状态来实现条件特征学习,从而允许对可见-隐藏节点对进行调制。不同于以递归方式将先前语音帧堆叠为第三单元,我们将相关权重系数分配给上下文相邻帧。具体而言,设计了一个阈值函数以捕获长期特征并融合全局存储的语音结构。引入因子化低秩近似来减少三维交互张量的参数,并施加非负约束以解决稀疏特性。通过ROC曲线下面积(AUC)和信号失真比(SDR)的验证表明,我们的方法在各种噪声环境中优于几种现有的1D和2D(即时间和时频域)语音检测算法。

关键词

引用

@article{arxiv.1611.00326,
  title  = {Enhanced Factored Three-Way Restricted Boltzmann Machines for Speech Detection},
  author = {Pengfei Sun and Jun Qin},
  journal= {arXiv preprint arXiv:1611.00326},
  year   = {2017}
}

备注

8 pages, Pattern Recognition Letter 2016