语音信号的深度分解
音频与语音处理
2018-03-05 v1 计算与语言
机器学习
声音
摘要
语音信号中混合了多种信息性因子,导致解码任一因子都极为困难。一种直观想法是将每帧语音分解为各个信息性因子,但这被证明极其困难。最近,我们发现曾被认为是长期分布属性的说话人特征实际上是短时模式,并可由精心设计的深度神经网络(DNN)学习。这一发现催生了本文将介绍的级联深度分解(CDF)框架。所提框架以顺序方式推断语音因子,先前推断出的因子在推断其他因子时用作条件变量。我们将展示该方法可有效分解语音信号,且利用这些因子能以高准确度恢复原始语音谱。这种分解与重构方法对许多语音处理任务具有潜在价值,例如说话人识别与情感识别,本文将予以演示。
引用
@article{arxiv.1803.00886,
title = {Deep factorization for speech signal},
author = {Lantian Li and Dong Wang and Yixiang Chen and Ying Shi and Zhiyuan Tang and Thomas Fang Zheng},
journal= {arXiv preprint arXiv:1803.00886},
year = {2018}
}
备注
Accepted by ICASSP 2018. arXiv admin note: substantial text overlap with arXiv:1706.01777