中文

一种用于单声道语音增强的精炼底层信息框架

音频与语音处理 2023-12-27 v2 声音 信号处理

摘要

有监督语音增强已从近期的神经网络进展中获益匪浅,特别是得益于其非线性拟合目标语音多样化表示(如波形或频谱)的能力。然而,这些直接拟合方案在听觉评估中仍面临语音退化与残留噪声的挑战。通过在本文中将语音增强与信息瓶颈原理相联系,我们重新思考了一种通用的即插即用策略,并提出了一种名为 RUI 的精炼底层信息框架,以在理论与实践两方面迎接这些挑战。具体而言,我们首先将语音增强的目标转化为综合语音特征与个体语音特征(例如频谱特征与声学特征)之间互信息的增量收敛问题。如此一来,与现有的直接拟合方案相比,底层信息源于给定频谱特征下声学特征的条件熵。因此,我们基于熵的链式法则设计了一个双路多重精炼迭代器,以精炼此底层信息从而进一步逼近目标语音。在 DNS-Challenge 数据集上的实验结果表明,我们的方案在仅增加 1.18 M 参数的情况下,相较于基线持续提升了 0.3+ 的 PESQ 分数。源代码可在 https://github.com/caoruitju/RUI_SE 获取。

关键词

引用

@article{arxiv.2312.11201,
  title  = {A Refining Underlying Information Framework for Monaural Speech Enhancement},
  author = {Rui Cao and Tianrui Wang and Meng Ge and Longbiao Wang and Jianwu Dang},
  journal= {arXiv preprint arXiv:2312.11201},
  year   = {2023}
}

备注

5 pages