基于谱峭度和双深先验的无监督语音增强
声音
2024-07-08 v1 音频与语音处理
摘要
本文提出一种基于深先验 (DP) 的无监督 DNN 语音增强方法。此处,DP 表示 DNN 更倾向于产生干净的语音信号而非噪声。传统方法基于 DP 通常涉及使用随机噪声特征作为输入对带噪语音信号进行训练,仅在生成干净语音信号后停止训练。然而,这些传统方法面临确定最佳停止时机的挑战,因环境背景噪声导致性能下降,以及干扰信号与噪声消除性能之间的权衡。为此,我们利用两个 DNN:一个用于生成干净语音信号,另一个用于生成噪声。这两个网络的组合输出可接近于带噪语音信号,损失函数中引入基于谱峭度的术语,用于将带噪语音信号分解为干净语音信号和噪声。本方法的关键优势在于能够规避权衡和早停问题,因为信号经过足够的迭代步骤进行分解。通过评估实验,我们表明所提出的方法在白高斯噪声和环境噪声情况下均优于传统方法,有效缓解了早停问题。
引用
@article{arxiv.2407.03887,
title = {Unsupervised speech enhancement with spectral kurtosis and double deep priors},
author = {Hien Ohnaka and Ryoichi Miyazaki},
journal= {arXiv preprint arXiv:2407.03887},
year = {2024}
}
备注
11 pages, 12 figures, and 2 Tables, submitted to Acoustical Science and Technology