中文

基于WaveNet的语音带宽扩展

音频与语音处理 2019-07-12 v1 机器学习 声音 信号处理

摘要

大规模移动通信系统往往包含具有窄带瓶颈的传统传输信道,导致特征的“电话质量”音频。尽管存在更高质量编解码器,但由于网络规模与异构性,以现代高质量音频编解码器传输更高速率音频在实践中可能困难。本文提出一种方法,其中通信节点可转而扩展可能已通过低速率编解码器的带限传入语音信号的带宽。为此,我们提出一种基于WaveNet的模型,以8 kHz带宽受限语音音频信号及具GSM全速率(FR)压缩伪影的音频的log-mel谱图表示为条件,以重建更高分辨率信号。在我们的实验MUSHRA评估中,我们展示一个训练为从经8 kHz GSM-FR编解码器音频上采样至24 kHz语音信号的模型,能够重建仅略低于16 kHz自适应多速率宽带音频编解码器(AMR-WB)质量的音频,并弥合了原始编码信号与24 kHz采样原始语音间感知质量约一半的差距。我们进一步展示,当同一模型输入未压缩的8 kHz音频时,能够在同一MUSHRA评估中再次重建略优于16 kHz AMR-WB的音频。

关键词

引用

@article{arxiv.1907.04927,
  title  = {Speech bandwidth extension with WaveNet},
  author = {Archit Gupta and Brendan Shillingford and Yannis Assael and Thomas C. Walters},
  journal= {arXiv preprint arXiv:1907.04927},
  year   = {2019}
}