使用心理声学模型启发的融合框架进行单通道语音增强
声音
2025-12-18 v2 音频与语音处理
摘要
当基于人类听觉系统特性选择用于语音增强的贝叶斯短时谱幅度(STSA)估计器的参数时,该估计器的增益函数变得更加灵活。尽管这种声学域中的估计器在降低高频背景噪声方面相当有效,但它会产生更多的语音失真,这使得在强噪声条件下,语音的高频内容(如摩擦音)变得难以感知,从而导致可懂度降低。另一方面,利用调制域中频率选择性心理声学证据的语音增强方案,被发现能够大幅提高带噪语音的可懂度,但由于其固有的设计约束,也存在时间模糊问题。为了在感知语音质量和可懂度方面实现共同提升,我们提出并研究了一种融合框架,该框架结合了声学域和调制域方法的优点,同时避免了它们各自的缺点。客观指标评估表明,与其他基线技术相比,所提出的语音增强融合框架能够在各种噪声条件下,在不同信噪比水平下,持续改善感知语音质量和可懂度。
引用
@article{arxiv.2202.05272,
title = {Single-channel speech enhancement by using psychoacoustical model inspired fusion framework},
author = {Suman Samui},
journal= {arXiv preprint arXiv:2202.05272},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2202.04882