中文

神经声码器即你所需要的一切:用于语音超分辨率

音频与语音处理 2023-10-10 v1 人工智能 机器学习 声音 信号处理

摘要

语音超分辨率(SR)是一项通过生成高频分量来提高语音采样率的任务。现有的语音超分辨率方法在受限的实验设置下训练,例如固定的上采样比。这些强约束可能导致在失配的真实世界场景中泛化能力较差。本文提出一种基于神经声码器的语音超分辨率方法(NVSR),可处理多种输入分辨率和上采样比。NVSR由梅尔带宽扩展模块、神经声码器模块和后处理模块组成。我们所提出的系统在VCTK多说话人基准上取得了最先进(state-of-the-art)的结果。在44.1 kHz目标分辨率下,NVSR在对数谱距离上分别比WSRGlow和Nu-wave高出8%和37%,并实现了显著更好的感知质量。我们还通过采用简单复制填充方法进行梅尔带宽扩展,证明了预训练声码器中的先验知识对语音超分辨率至关重要。样本可在 https://haoheliu.github.io/nvsr 查看。

关键词

引用

@article{arxiv.2203.14941,
  title  = {Neural Vocoder is All You Need for Speech Super-resolution},
  author = {Haohe Liu and Woosung Choi and Xubo Liu and Qiuqiang Kong and Qiao Tian and DeLiang Wang},
  journal= {arXiv preprint arXiv:2203.14941},
  year   = {2023}
}

备注

Submitted to INTERSPEECH 2022