基于感知驱动优化与双变换的语音增强
声音
2022-09-27 v1 人工智能
计算与语言
机器学习
音频与语音处理
摘要
针对单通道语音增强问题,已有大量研究通过在时域对从语音混合中习得的内域进行操作,或在时频域对固定的全频带短时傅里叶变换(STFT)谱图进行操作来增强语音。最近,少数基于子带的语音增强研究被提出。通过对子带谱图进行操作来增强语音,这些研究在 DNS2020 基准数据集上展示了具有竞争力的性能。尽管引人注目,这一新研究方向尚未被充分探索,仍有改进空间。因此,在本研究中,我们深入探究这一最新研究方向,并提出一种基于子带、具有感知驱动优化与双变换的语音增强系统,称为 PT-FSE。具体而言,我们提出的 PT-FSE 模型通过三方面改进其骨干网络——一个全频带与子带融合模型。首先,我们设计了一个频率变换模块,旨在增强全局频率相关性。随后引入时间变换以捕获长距离时间上下文。最后,提出一种利用人类听觉感知特性、促使模型聚焦于低频增强的新损失函数。为验证所提模型的有效性,我们在 DNS2020 数据集上进行了大量实验。实验结果表明,我们的 PT-FSE 系统相较其骨干网络有显著提升,且在规模比 SOTA 小 27% 的情况下优于当前最先进水平。在基准数据集上取得平均 NB-PESQ 为 3.57,我们的系统提供了迄今报道的最佳语音增强结果。
引用
@article{arxiv.2209.11905,
title = {Speech Enhancement with Perceptually-motivated Optimization and Dual Transformations},
author = {Xucheng Wan and Kai Liu and Ziqing Du and Huan Zhou},
journal= {arXiv preprint arXiv:2209.11905},
year = {2022}
}