中文

NU-GAN:基于GAN的高分辨率神经上采样

声音 2020-10-23 v1 人工智能 计算与语言 机器学习 音频与语音处理

摘要

在本文中,我们提出NU-GAN,一种将音频从较低采样率重采样到较高采样率(上采样)的新方法。音频上采样是一个重要问题,因为生成式语音技术的产品化需要在高采样率下运行。此类应用使用44.1 kHz或48 kHz分辨率的音频,而当前语音合成方法最多只能处理24 kHz分辨率。NU-GAN通过利用基于GAN的音频生成技术,作为文本到语音(TTS)流水线中一个独立组件,向解决音频上采样问题迈出一步。ABX偏好测试表明,我们的NU-GAN重采样器能够将22 kHz音频重采样至44.1 kHz,在单说话人数据集上仅比随机机会高7.4%被判别为与原始音频不同,在多说话人数据集上比机会高10.8%。

关键词

引用

@article{arxiv.2010.11362,
  title  = {NU-GAN: High resolution neural upsampling with GAN},
  author = {Rithesh Kumar and Kundan Kumar and Vicki Anand and Yoshua Bengio and Aaron Courville},
  journal= {arXiv preprint arXiv:2010.11362},
  year   = {2020}
}