时频掩码的深层语音修复
声音
2020-11-12 v5 计算与语言
音频与语音处理
摘要
在噪声环境中经常出现的瞬态强干扰可完全淹没语音信号,导致不可避免的信息丢失。尽管现有的噪声抑制算法能取得令人印象深刻的成果,但在极低信噪比或信号部分缺失时其效果仍然有限。为应对这些局限,本文提出一种用于语音修复的端到端框架,即基于上下文检索语音时频表示中缺失或严重失真部分的方法。该框架基于卷积 U-Net,通过深度特征损失进行训练,所用深度特征损失由 speechVGG(一种在辅助词分类任务上预训练的深层语音特征提取器)获得。我们的评估结果表明,所提框架能够恢复语音时频表示中大面积缺失或失真部分,带宽可达 400 ms 与 3.2 kHz。特别地,我们的方法使初始受损语音样本的 STOI 与 PESQ 客观指标得到显著提升。值得注意的是,与传统方法相比,使用深度特征损失训练该框架取得了最佳结果。
引用
@article{arxiv.1910.09058,
title = {Deep speech inpainting of time-frequency masks},
author = {Mikolaj Kegler and Pierre Beckmann and Milos Cernak},
journal= {arXiv preprint arXiv:1910.09058},
year = {2020}
}
备注
Accepted to InterSpeech2020