中文

基于掩码后滤波器的编码语音增强

音频与语音处理 2020-10-13 v1 机器学习 信号处理

摘要

语音编解码器在低比特率下由于量化噪声较高而质量下降。通常采用后滤波器来增强编码语音的质量。本文提出一种依赖时频域掩码的数据驱动后滤波器。实现了全连接神经网络(FCNN)、卷积编解码器(CED)网络以及长短期记忆(LSTM)网络,以估计每个时频单元的实值掩码。所提模型在自适应多速率宽带编解码器(AMR-WB)的五种最低工作模式(6.65 kbps–15.85 kbps)上进行了测试。客观与主观评价均证实了编码语音的增强效果,并表明基于掩码的神经网络系统优于标准中使用的如 ITU-T G.718 之类的传统启发式后滤波器。

关键词

引用

@article{arxiv.2010.05571,
  title  = {Enhancement Of Coded Speech Using a Mask-Based Post-Filter},
  author = {Srikanth Korse and Kishan Gupta and Guillaume Fuchs},
  journal= {arXiv preprint arXiv:2010.05571},
  year   = {2020}
}

备注

ICASSP 2020 - 2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)