中文

用于单通道语音增强的基于听觉模型的相位感知贝叶斯谱幅度估计器

声音 2022-02-11 v1 音频与语音处理

摘要

短时谱幅度的贝叶斯估计是增强含噪语音的最主要方法之一。当考虑任何感知相关的代价函数时,这些估计器的性能通常会得到显著改善。另一方面,基于相位的语音信号处理的最新进展表明,基于谱相位估计方法的纯相位增强也能在感知语音质量和可懂度上实现联合提升,即使在低信噪比条件下也是如此。在本文中,为了利用涉及估计和真实纯净语音 STSA 的感知驱动代价函数以及先验谱相位信息的优势,我们推导了一个相位感知贝叶斯 STSA 估计器。代价函数的参数是根据人类听觉系统的特性选择的,即耳蜗的动态压缩非线性、感知响度理论以及耳朵的同时掩蔽特性。这种参数选择方案在限制语音失真的同时实现了更多的降噪。如果先验相位信息可用,则推导出的 STSA 估计器在 MMSE 意义下是最优的。然而在实际中,通常只能通过采用过去几年发展起来的不同类型的谱相位估计技术来获得纯净语音相位的估计。在盲设置中,我们使用文献中可用的不同标准相位估计方法评估了所提出的贝叶斯 STSA 估计器。实验结果表明,与传统的相位盲方法相比,所提出的估计器可以实现显著的性能提升。

关键词

引用

@article{arxiv.2202.04882,
  title  = {Auditory Model based Phase-Aware Bayesian Spectral Amplitude Estimator for Single-Channel Speech Enhancement},
  author = {Suman Samui and Indrajit Chakrabarti and Soumya K. Ghosh},
  journal= {arXiv preprint arXiv:2202.04882},
  year   = {2022}
}

备注

Submitted to IEEE