我们能信任深度语音先验吗?
声音
2020-11-05 v1 机器学习
音频与语音处理
摘要
近年来,基于深度语音先验的语音增强(SE)引起了广泛关注,例如结合非负矩阵分解的变分自编码器(VAE-NMF)架构。与使用低秩协方差高斯等浅层模型表示干净语音的传统方法相比,新方法采用深度生成模型来表示干净语音,通常能提供更好的先验。尽管在理论上具有明显优势,我们认为深度先验必须谨慎使用,因为深度生成模型产生的似然并不总是与语音质量一致。我们针对该问题设计了一项全面研究,并表明基于深度语音先验可以取得合理的 SE 性能,但结果可能并非最优。细致的分析表明,这一问题深深根植于深度生成模型的灵活性与最大似然(ML)训练本质之间的不和谐。
引用
@article{arxiv.2011.02110,
title = {Can We Trust Deep Speech Prior?},
author = {Ying Shi and Haolin Chen and Zhiyuan Tang and Lantian Li and Dong Wang and Jiqing Han},
journal= {arXiv preprint arXiv:2011.02110},
year = {2020}
}
备注
To be published in IEEE SLT 2021