Avocodo:用于无伪影声码器的生成对抗网络
音频与语音处理
2023-01-04 v3 人工智能
声音
摘要
基于生成对抗神经网络(GAN)的神经声码器因其快速推理速度和轻量网络结构,同时能生成高质量语音波形而被广泛使用。由于感知上重要的语音成分主要集中在低频带,大多数基于GAN的声码器执行评估下采样语音波形的多尺度分析。这种多尺度分析有助于生成器提高语音可懂度。然而,在初步实验中,我们发现专注于低频带的多尺度分析会导致非预期的伪影,例如混叠和成像伪影,从而降低合成语音波形的质量。因此,本文研究了这些伪影与基于GAN的声码器之间的关系,并提出了一种称为Avocodo的基于GAN的声码器,能够合成高保真且伪影减少的语音。我们引入了两类判别器从不同角度评估语音波形:协作多带判别器和子带判别器。我们还利用伪正交镜像滤波器组来获取下采样的多带语音波形,同时避免混叠。实验结果表明,Avocodo在客观和主观评价上均优于基线基于GAN的声码器,同时再现出伪影更少的语音。
引用
@article{arxiv.2206.13404,
title = {Avocodo: Generative Adversarial Network for Artifact-free Vocoder},
author = {Taejun Bak and Junmo Lee and Hanbin Bae and Jinhyeok Yang and Jae-Sung Bae and Young-Sun Joo},
journal= {arXiv preprint arXiv:2206.13404},
year = {2023}
}
备注
Accepted for publication in the 37th AAAI conference on artificial intelligence (AAAI 2023)