语音信号的深度分解
声音
2017-06-27 v2 机器学习
摘要
语音信号是各种信息因子的复杂混合,这种信息混合使得解码任何单个因子都极其困难。一个自然的想法是将每个语音帧分解为独立的因子,但这事实证明比解码每个单独因子更加困难。一个主要障碍是说话人特征(语音信号中的一个主要因子)一直被怀疑是一种长期分布模式,因此在帧级别上无法识别。在本文中,我们证明了说话人因子也是一种短时频谱模式,并且可以使用简单的深度神经网络(DNN)仅通过几帧即可在很大程度上进行识别。这一发现激发了一种级联深度分解(CDF)框架,该框架以顺序方式推断语音因子,并将先前推断的因子用作推断其他因子时的条件变量。我们在自动情感识别(AER)任务上的实验表明,这种方法可以有效地分解语音信号,并且利用这些因子,可以高精度地恢复原始语音频谱。这种分解和重建方法为许多语音处理任务提供了一种新颖的工具。
引用
@article{arxiv.1706.01777,
title = {Deep Factorization for Speech Signal},
author = {Dong Wang and Lantian Li and Ying Shi and Yixiang Chen and Zhiyuan Tang},
journal= {arXiv preprint arXiv:1706.01777},
year = {2017}
}