用于单通道语音增强的全循环特征提取
音频与语音处理
2021-06-07 v7 声音
摘要
卷积神经网络(CNN)模块被广泛用于构建高端语音增强神经模型。然而,所集成的 vanilla CNN 模块的特征提取能力受卷积核维度约束的限制——因而它们在特征提取阶段充分建模噪声上下文信息方面存在局限。为此,我们在特征提取 CNN 层中引入循环因子,提出一种用于单通道语音增强的鲁棒上下文感知特征提取策略。如所示,添加循环可在提取特征层面捕获噪声属性的局部统计,因此所提模型即使在极噪条件下也能有效区分语音线索。在与使用 vanilla CNN 模块的增强模型进行比较的未见噪声条件下评估时,所提在特征提取层具循环性的模型产生了高达 1.5 dB 的分段信噪比(SSNR)增益、平均意见得分量表中 0.4 的主观质量提升,同时待优化参数减少了 25%。
引用
@article{arxiv.2006.05233,
title = {A fully recurrent feature extraction for single channel speech enhancement},
author = {Muhammed PV Shifas and Santelli Claudio and Vassilis Tsiaras and Yannis Stylianou},
journal= {arXiv preprint arXiv:2006.05233},
year = {2021}
}
备注
5 pages