基于注意力机制并利用人类质量感知建模的语音增强
音频与语音处理
2023-03-27 v1 信号处理
摘要
感知启发的目标函数,如语音质量感知评估(PESQ)、信噪失真比(SDR)和短时客观可懂度(STOI),近来已被用于优化基于深度学习的语音增强算法性能。然而,这些目标函数并不总是与听者对感知质量的评价强相关,因此以这些措施优化常导致在真实场景中的表现更差。本工作中,我们提出一种基于注意力机制的增强方法,利用从平均意见得分(MOS)预测模型学到的语音嵌入向量与语音增强模块联合增强带噪语音。该 MOS 预测模型直接由音频信号估计听者所评估的感知语音质量 MOS。增强模块还采用量化语言模型以施加频谱约束,从而获得更好的语音真实感与性能。我们使用在日常环境中采集的真实世界带噪语音数据训练模型,并以未见过的数据集测试。结果表明,我们提出的方法显著优于其他以客观度量优化的方法,其预测质量分数与人类判断强相关。
引用
@article{arxiv.2303.13685,
title = {Attention-based Speech Enhancement Using Human Quality Perception Modelling},
author = {Khandokar Md. Nayem and Donald S. Williamson},
journal= {arXiv preprint arXiv:2303.13685},
year = {2023}
}
备注
11 pages, 4 figures, 3 tables, submitted in journal TASLP 2023