中文

用于直接从复频谱提取语音参数的复值受限Boltzmann机

音频与语音处理 2018-03-28 v1 机器学习 声音 机器学习

摘要

本文描述了一种新颖的基于能量的概率分布,它能够表示复值数据,并解释了如何将其应用于从复值频谱中直接提取特征。所提出的模型,即复值受限Boltzmann机 (CRBM),被设计为处理复值可见单元,作为著名的受限Boltzmann机 (RBM) 的扩展。与 RBM 一样,CRBM 学习可见单元与隐藏单元之间的关系,而同一层内的单元之间没有连接,这通过使用 Gibbs 采样或对比散度 (CD) 极大地提高了训练效率。另一个重要特征是,CRBM 在每个复值可见单元的实部和虚部之间也有连接,有助于在复数域中表示数据分布。在语音信号处理中,分类和生成特征通常基于幅度谱(例如 MFCC、倒谱和mel倒谱),即使它们是从复频谱计算得出的,也会忽略相位信息。相比之下,使用 CRBM 的所提特征提取器将复频谱(或复频谱的另一种复值表示)直接编码为二值潜在特征(隐藏单元)。由于可见-隐藏连接是无向的,我们也可以直接从潜在特征恢复(解码)复频谱。我们的语音编码实验表明,CRBM 优于其他语音编码方法,例如使用传统 RBM、mel对数频谱近似 (MLSA) 解码器等的方法。

关键词

引用

@article{arxiv.1803.09946,
  title  = {Complex-Valued Restricted Boltzmann Machine for Direct Speech Parameterization from Complex Spectra},
  author = {Toru Nakashika and Shinji Takaki and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:1803.09946},
  year   = {2018}
}

备注

Under the IEEE T-ASLP Review